看懂模型参数:上下文长度、参数量、量化,各自影响什么
每次模型发布,一堆参数扑面而来。这篇只回答一个问题:哪个数字会影响我的日常使用。
参数量(7B / 70B / …)
影响什么:模型的「知识储备」和复杂推理能力上限。
不影响什么:它不等于「更听话」也不等于「更适合你的任务」。小模型经过针对性训练,在特定任务上超过大模型是常事。
对你的意义:本地部署时它直接决定显存需求;用在线服务时,它主要体现在价格上。
上下文长度(8K / 128K / 1M)
影响什么:一次能塞进去多少内容。
这是最被高估也最被误解的指标。两个要点:
- 支持长 ≠ 用得好。很多模型在超长上下文中间部分的信息召回率明显下降,业内叫「中间迷失」。所以别指望塞 100 万字进去还能精准问答
- 长上下文很贵。按 Token 计费的话,一次长上下文调用的成本可能是普通调用的几十倍
实用做法:能用检索(RAG)解决的,不要靠堆上下文。
量化(FP16 / INT8 / INT4)
影响什么:本地部署的显存占用和精度。只有本地跑才需要关心,用在线服务的完全不用管。
其他常见指标
- 各种榜单分数:参考价值有限。榜单题目容易被针对性优化,且和你的具体任务未必相关
- 速度 / 首字延迟:做交互式产品时很重要,做批处理时基本无所谓
- 是否支持函数调用 / 结构化输出:如果你要接进程序,这个比参数量重要得多
一句话总结
选模型时,先看功能边界(支不支持你要的能力),再看成本,最后才看性能指标。大多数人的顺序是反的。
本资源整理自互联网公开渠道,仅供学习与交流使用,请在下载后 24 小时内删除。商业用途请自行获取正版授权。如有侵权请第一时间联系我们处理。