按任务选模型,而不是按榜单:一个四象限判断法
选模型时看榜单,是最省事也最不准的方法。榜单测的是一组通用题目上的平均表现,而你的活是具体的:可能只需要分类,可能需要严格的格式,可能一天要跑十万次。
这几种情况下,榜单名次几乎没有参考价值。
一、真正该问的两个问题
二、按任务类型的经验对照
下面是一个粗粒度的对照,用来缩小候选范围,不是精确推荐:
三、自建评测:三步,一个下午能做完
与其看别人的榜,不如做一份自己的。方法很朴素:
做完这一次,你会得到一个比任何榜单都有用的东西:针对你自己任务的排名。而且以后每次有新模型出来,跑一遍就知道要不要换。
四、几个常见的选型误区
- “用最强的总没错”——成本会失控,而且强模型未必更听话。格式约束类任务上,有时小模型反而更稳定。
- “参数量越大越好”——参数量只说明了模型有多大,没说明它训得怎么样,也没说明它适不适合你的活。
- “换模型就能解决”——如果提示词本身没写清楚,换任何模型都是一样的结果。先查提示词。
- “选一个用到底”——不同环节完全可以用不同模型。初筛用便宜的、复核用强的,是很成熟的做法。
五、一个提醒
模型迭代很快,任何”某某模型最好”的结论保质期都很短。但你的评测样本集不会过期。把精力花在建样本集上,而不是记住某个当下的排名——前者是资产,后者是消耗品。
本资源整理自互联网公开渠道,仅供学习与交流使用,请在下载后 24 小时内删除。商业用途请自行获取正版授权。如有侵权请第一时间联系我们处理。