AI能力排行榜可信吗?简单说:可以信一点,但不能全信。它更像一张参考地图,不是最终判决书。
如果一个榜单满足这些条件,可信度就比较高:由独立第三方做,不靠厂商赞助;测试方法公开;匿名盲测;题目保密,还会定期更换;不只考选择题,还考写作、编程、推理、中文、长文本等;结果能被别人复现。这样的榜单,至少能反映大概水平。
但很多榜单也有硬伤。第一,模型可能见过测试题,分数会虚高。第二,不同榜单考的东西不一样,数学第一不代表聊天最好,代码第一也不代表写文案最好。第三,厂商可能针对榜单优化,甚至刷榜。第四,主观体验很难排名,同一个回答,有人喜欢简洁,有人喜欢详细。第五,模型更新很快,榜单可能已经过时。第六,提问方式变一下,结果就可能差很多。
所以,排行榜的可信度要分情况看。独立、透明、盲测、多任务的榜单,比较可信。方法公开但题目固定的榜单,只能参考。厂商自己宣传,或者只挑对自己有利指标的榜单,看看就好。
对普通人来说,怎么用呢?别只看一个榜,最好综合看三四个。先明确你要干什么,比如写文案、学外语、写代码、做数学、处理长文档。然后看榜单里和你需求相关的维度。再看日期和版本,别拿旧排名选新模型。最后亲自试用,用你自己的真实问题考它。觉得好用、价格合适、速度能接受,才是适合你的。
总结:AI能力排行榜有限可信。它能帮你缩小选择范围,但不能替你决定。参考可以,盲从不行。尤其别因为某个模型排第一,就认为它所有方面都最强。 |
|