上一篇文章中介绍的“只要能用日语提问,不都一样吗?“这一回答,其实背后还有两个理由:①生成式AI的技术发展速度过快②各服务的内部是黑箱。因为①,即便谈论此时此刻哪个服务更优秀,这一优劣在几个月后也可能已经互换。因为②,从外部直接验证各服务的内部结构或训练数据的全貌十分困难,容易被谈论的是”用过之后的感受“这种主观体验。但那是N=1(自己一个人)的评价,未必能推广到其他使用者或用途。

另一方面,即便内部看不见,输出的回答本身是可以衡量的。让模型解基准测试、匿名对比后投票、统计实际处理的量——都是不打开内部、而从外部衡量的方法。不过其结果会因评测课题、使用者群体、统计方法而变化。正因如此,本文不写“当下第一名是哪个模型”(如①所述,写下的那一刻起就开始过时)。取而代之,我们梳理当你想了解时可以自行确认的地方——三个不依赖特定生成式AI厂商的外部数据源,Artificial AnalysisLMArenaOpenRouter——各自衡量什么、如何衡量,该看哪里,以及阅读时的注意点。

结论 —— 三个站点衡量的是“不同的东西”

Artificial AnalysisLMArenaOpenRouter
衡量什么以基准测试衡量综合性能、速度与价格使用者的匿名投票(人的偏好)经由OpenRouter处理的token量
方法多个基准测试的复合指标对比两个模型的回答后投票按周统计经由自家API的使用量
看哪里Models页面的Intelligence IndexLeaderboard的分数与置信区间Rankings的每周份额
主要注意点指标版本改变则无法比较存在对排名操纵的学术批评既非质量也非使用者数

三者的答案不一致,并不是因为其中某个错了,而是因为所衡量的东西不同。事实上,即便在撰写本文的2026年7月,基准测试或投票的上位,与实际使用量的上位,其阵容也大相径庭。哪个是“当下第一”这里不写——只要掌握了确认方法,随时都能自行取得最新的答案。区分使用如下:

  • 想了解在多个基准测试上的综合性能 → Artificial Analysis。但务必附上分数的版本(如v4.1)与取得日期
  • 想了解哪种回答更易被人喜欢 → LMArena。但上位的排名幅度(Rank Spread)大幅重叠,不要将细微的排名差直接读作性能差
  • 想了解实际被大量使用的模型 → OpenRouter。但要认清这是与质量、使用者数、采用企业数均不一致的token处理量指标

以下,逐一确认每个站点的“机制”与“看法”。

Artificial Analysis —— 以基准测试衡量“综合性能、速度与价格”

Artificial Analysis 是以独立立场分析AI模型与API提供商的民营站点。其特征在于,不仅是性能,还将速度与价格摆在同一平台上。据官方的方法论页面,衡量对象包括综合性能(后述的复合指标)、返回首个token所需的时间(Time to First Token)、输出速度(每秒token数)、价格(输入/输出token单价)等,采用的不是目录值,而是实际调用API所得的实测值。

性能的核心指标,是组合了多个基准测试(编程、科学、推理等9种)的复合分数 Artificial Analysis Intelligence Index

看法 —— 打开 Models页面,可以跨模型一览Intelligence Index、输出速度、延迟、价格、上下文长度,主要指标可免费查看(数据导出、API、自定义分析属于付费方案的范围)。想了解“当下综合性能、速度、价格平衡良好的是哪个模型”时,先看这里是捷径。

阅读时的注意点有两个。第一,Intelligence Index 有版本(撰写时为v4.1),版本升级时基准测试的构成会更换,因此不同版本的分数之间无法比较。引用分数时,需要将版本与取得日期一并附上。第二,模型名的括注。排名中可能列出的并非单一的市售模型,而是在特定设定或配置下的测量值,如“(with fallback)“”(max)“,因此需要确认你所看的是否与你所用的模型、设定相同。

LMArena —— 以人工投票衡量“更喜欢哪一个回答”

LMArena(旧称Chatbot Arena;当前的正规域名是arena.ai)是由加州大学伯克利分校的研究者们创立的投票型评测平台。机制很简单:使用者投入一个提示词,两个匿名模型作出回答,使用者为自认为更好的一方投票。由于模型名在投票之前一直隐藏,其设计使品牌先入之见不易介入。统计采用Bradley-Terry模型(一直以来被称为“Elo”的方法的实质),分数附有置信区间。

看法 —— 在 文本部门排行榜 上,可以连同各模型的分数一起确认置信区间(±的幅度),以及表示排名不确定性的“Rank Spread”。这里很重要:上位模型的排名幅度大幅重叠,不应将细微的排名读作明确的性能差。正确的用法不是寻找“第一名的模型”,而是读取“排名幅度相互重叠的上位群组”。除文本外,还备有图像、视频、Web开发等分部门的排行榜。

长处在于,与静态的基准测试不同,是实际的使用者用实际的问题进行评价。可以说是有关人类偏好的世界最大级别的系统性数据。

学术批评 ——“The Leaderboard Illusion”

另一方面,这一机制存在学术批评。由Cohere、Allen Institute for AI等13名研究者于2025年4月发表的论文“The Leaderboard Illusion”,指出了扭曲排行榜公平性的结构性问题。

Yet, in this work we identify systematic issues that have resulted in a distorted playing field. We find that undisclosed private testing practices benefit a handful of providers who are able to test multiple variants before public release and retract scores if desired.

(然而在本研究中,我们识别出扭曲竞争条件的结构性问题。未公开的非公开测试做法使少数提供商获益,他们能够在公开发布前测试多个变体,并在愿意时撤回分数。)

论文具体举出:Meta在公开Llama-4之前测试了27种非公开变体;封闭模型越发倾向于被分配到更多的对战次数;其结果是,Google与OpenAI各自获得了竞技场全部数据的估计约19~20%,而83个开放权重模型的合计仅停留在估计的29.7%。

对此,LMArena在官方博客上予以反驳,指出开放模型的对战比率按官方统计为40.9%,且事前测试带来的分数上升在实测中仅停留在“50次测试与3,000票约+11 Elo”,论文的估算是基于模拟的。同时,它接受了部分指摘,并提及了明示事前测试方针等改进。投票型评价与“操纵的余地”相邻,排名应作为参考值、带着幅度来读——这是从论文与反驳双方都能引出的实务教训。

OpenRouter ——衡量“实际处理了多少”

OpenRouter 不是评测站点,而是将众多AI模型的API汇聚到单一入口的中转服务(美国OpenRouter, Inc)。正因这一立场,它拥有经由该服务实际处理的各模型的token量这一与基准测试、投票均不同的数据,并在 排名页面 公开每周的使用量份额。

看法 —— 在Rankings页面,可以确认按模型、按提供方的每周token份额。还有编程、Agent、推理等按用途的切换,可以看出“在此用途下实际有大量token流经的模型”(不仅包括生产采用,也包括个人使用、实验、免费模型的大量使用)。基准测试的上位常客,与这里的上位阵容常常大不相同,这本身正是这份数据的趣味所在。

阅读时的注意点 —— 这是与质量、使用者数、采用企业数、生产采用数均不一致的token处理量指标。由于强烈受到免费提供或价格低廉、大量的自动处理、部分大宗使用者的影响,“被大量处理”并不意味着“性能高”。此外,统计对象仅限于经由OpenRouter的使用,不包括直接与OpenAI或Anthropic的API签约的大宗使用。

其他独立信息源

除这三个站点外,偏向实务的评价还有:衡量能否解决真实存在的GitHub问题的 SWE-bench(源自普林斯顿大学)、横跨众多场景评测的斯坦福大学的 HELM、追踪AI的计算资源与能力变迁的独立研究机构 Epoch AI 等,均是独立于厂商、经得起引用的信息源。

小结

  • “当下最好的模型”变动过快,从写进文章的那一刻起就开始过时。需要的不是背诵答案,而是知道可以确认的地方
  • 独立于厂商的数据源的代表,是Artificial Analysis(基准测试)、LMArena(人工投票)、OpenRouter(token处理量)三个。因为衡量的东西不同,答案也不一致
  • Artificial Analysis 可在Models页面免费一览综合性能、速度与价格。但版本(如v4.1)不同的分数无法比较,模型名的括注(配置、设定)也需注意
  • LMArena 不仅看分数,还要看置信区间与Rank Spread。上位的排名幅度大幅重叠,不要将细微的排名差直接读作性能差。要兼顾围绕非公开测试的学术批评(The Leaderboard Illusion)与运营方的反驳,带着幅度来读
  • OpenRouter 的Rankings是经由OpenRouter的token处理量,并非质量或使用者数的指标。在认清这一点的基础上,可按用途眺望“实际大量流经的模型”
  • 无论引用哪个数值,都要将站点名、指标的版本、取得日期一并附上

参考资料