• 请不要在回答技术问题时复制粘贴 AI 生成的内容
fankcoder
V2EX  ›  程序员

大模型排行榜到底哪个权威?

  •  
  •   fankcoder ·
    fankcoder · 3 days ago · 9465 views

    Qwen3.8-max 出了,今天看排行榜 3 个榜 3 个名次,该信哪个呢?

    1. 排行第 4 https://arena.ai/leaderboard/code/webdev
    2. 排行第 7 https://llm-stats.com/
    3. 第十名之后去了 https://artificialanalysis.ai/leaderboards/models
    62 replies    2026-08-06 09:24:32 +08:00
    vzextreme
        1
    vzextreme  
       3 days ago
    看厂商对哪家测评机构特调🐶
    cowcomic
        3
    cowcomic  
       3 days ago
    arena 是匿名对比得分,这类稍微更偏向普通人的感官,我个人比较倾向这种竞技场排行的
    其他数据集评测的主要还是看测试数据分布和泄露情况了

    中文也有榜单
    https://www.superclueai.com/homepage
    tcper
        4
    tcper  
       3 days ago   ❤️ 9
    看评分标准,
    arena 就是通过匿名选择喜好,体现用户体验
    llm-stats 是多个评分集的聚合
    AA 自建评测集,这些集体现大模型对未知问题的推理能力

    不过客观来说,llm-stats 的聚合更能体现全面成绩,因为就算刷烂的题目成绩很好也不错了,起码能覆盖日常遇到的问题,并不是大模型都要去解决未知问题。
    lel020
        5
    lel020  
       3 days ago
    牛马 agent 使用还是得看社区评价,什么跑分都靠不住,
    Bootis
        6
    Bootis  
       3 days ago
    arena 都是 one shot 提示词任务,大型工程的复杂任务能力看这个榜单参考价值不大
    fankcoder
        7
    fankcoder  
    OP
       3 days ago
    @tcper 感谢
    opeth
        8
    opeth  
       3 days ago
    我基本上就看 artificial analysis 和最强野榜 https://llm2014.github.io/llm_benchmark
    wang93wei
        9
    wang93wei  
       3 days ago
    我个人觉得 DeepSWE 这个更权威一些。https://deepswe.datacurve.ai/
    klion
        10
    klion  
       3 days ago   ❤️ 1
    https://artificialanalysis.ai/leaderboards/models 里面重点关注这几个指标就知道,这些才是真正的模型智能

    Terminal-Bench Hard

    AA-Omniscience Accuracy

    Humanity’s Last Exam

    GPQA Diamond
    xiaoxixi
        11
    xiaoxixi  
       3 days ago
    好多排行站,之前都没关注过
    soulflysimple123
        12
    soulflysimple123  
       3 days ago
    https://artificialanalysis.ai/
    我看 Qwen3.8-max 里面还没有
    sillydaddy
        13
    sillydaddy  
       3 days ago
    我目前只看 arena ,它是基于两两比赛得到的,裁判是广大用户。
    rich1e
        14
    rich1e  
       3 days ago
    排行榜上的权威与真实体验,一些情况下并不相符合

    就像,在国产模型上使用 CC ,编程体验也还不错,但是遇到一些特定场景(视频分析 / 复杂逻辑推理),可能就不能工作

    - 视频分析时,可能会用到 claude vision
    - 复杂逻辑推理,会触发多个模型之间并行工作( Opus / Haiku / Sonnet )

    以上这些,如果模型没有适配,CC 就无法工作

    所以,大模型排行榜看看就好,权威也改变不了真实体验

    推荐这个,https://x.com/karpathy/status/2083749667410727319
    nakun233
        15
    nakun233  
       3 days ago
    当然是 DeepSWE 1.1
    kuhung
        16
    kuhung  
       3 days ago
    我个人还关心价格,即性价比。到了当前阶段,模型提升带来的体验上升已经很难如年初 opus4.6 那样了。我自己写了一个 https://www.traktoken.com/ 用来比价。此外,开发过程中还发现国外金融机构在观测 token 支出指数,用来指导投资,所以复现了一个 https://www.traktoken.com/spend-index 。从落地页来看,后者目前占一半的流量。
    sxbaixing
        17
    sxbaixing  
       3 days ago
    千问向来是跑分高,体验差
    mmdsun
        18
    mmdsun  
       3 days ago via iPhone
    论知名度还是 arena 靠谱
    OumaeKumiko
        19
    OumaeKumiko  
       3 days ago
    竟然还没有人发东山奈央的😂 俺也不知道是否权威
    [toyama nao - 知乎]( https://www.zhihu.com/people/toyama)
    uncleroot
        20
    uncleroot  
       3 days ago
    不知道有没有各种语言的“人味”排行。机器味太重了
    wakarimasen
        21
    wakarimasen  
       3 days ago via Android
    权威这两个字令人困惑。

    如果你要权威数据应该看厂商发布的第一方数据
    Wcowin
        22
    Wcowin  
       3 days ago
    具体场景具体分析吧,适合自己就是最强的。
    jonsmith
        23
    jonsmith  
       3 days ago
    编程方面不看好 Qwen ,跟 Gemini 一样,跑分高、编程能力不行。
    cabudad
        24
    cabudad  
       3 days ago
    什么排行榜都没有自己亲身使用权威,好不好用了才知道
    SeleiXi
        25
    SeleiXi  
       3 days ago
    让 gpt 找一些比较新+作者比较权威的 benchmark 调研一下,一般比较老或者比较有影响力的早就过拟合过了
    ybybwdwd
        26
    ybybwdwd  
       3 days ago
    @cowcomic arena 是可以刷的,可以用提示词试出是哪个模型
    levn
        27
    levn  
       3 days ago
    普通人类评价早就已经没用了在大多数时候
    jark006
        28
    jark006  
       3 days ago
    我比较信 DeepSWE
    Bootis
        29
    Bootis  
       3 days ago
    escapefear
        30
    escapefear  
       3 days ago
    我奉行对标谁就用谁的原则
    LK996
        31
    LK996  
       3 days ago
    和手机评测一样,都是给够前就上的婊子,没有干净的
    Znemo
        32
    Znemo  
       3 days ago   ❤️ 1
    哪个 Gemini 排名最低相信哪个。
    William337
        33
    William337  
       3 days ago
    没有,需要自行判断,仅供参考
    Haku
        34
    Haku  
       3 days ago via Android
    arean 是竞技场天梯,分数有保障,但是仅限前端(编程是只有前端)
    aes114514gcm
        35
    aes114514gcm  
       3 days ago
    @OumaeKumiko 8 楼的 https://llm2014.github.io/llm_benchmark 就是 toyama nao 的网站。个人感觉比较准确。
    JerryZhi
        36
    JerryZhi  
       3 days ago
    目前普遍思路是采集十几个排行榜求平均(或者加权)
    cellsyx
        37
    cellsyx  
       3 days ago
    比较符合个人体验的是 DeepSWE (不包括前端设计能力)
    FlashEcho
        38
    FlashEcho  
       3 days ago
    根据使用场景来的,如果你的需求只是和模型聊聊天,当成高级版豆包,那 Arena AI 其实最准
    Glauben
        39
    Glauben  
       3 days ago
    我有一个疑问,5.6SOL codex 明明是 258K272K ,为什么这些排行榜上都是 1.1M
    Mandelo
        40
    Mandelo  
       3 days ago
    没一个权威的,或者说测试的东西和你工作用用到的完全不是一个东西。
    mingtdlb
        41
    mingtdlb  
       3 days ago
    arena 的 side-by-side 不是一样可以选哪个更好,但这个结果是否参与排名不懂得,如果参与,那就可以刷了。。。

    我认为实际还是要自己测试,给一个任务,看哪个模型做的最合你意。排行榜随便看一个就行,一般都相差不会太多,比如 ds 在排行榜 1 是第十,在排行榜 2 就不会跑到第 30 去
    NQ
        42
    NQ  
       3 days ago
    那种修开源项目 PR 的可以看看,好歹能测出来一点工程能力,纯聊天或者写玩具项目的就算了。
    crackidz
        43
    crackidz  
       3 days ago
    这几个都不准,基本上看看差不多

    DeepSWE 相对比准一点点,但是不是全部

    大模型的评测现在仍旧是一个复杂的评测过程,我建议你看的时候需要根据不同的能力:比如逻辑推理能力、代码编写能力、写作能力等分开进行对比。这些每一个侧重点都不一样,在不同场景会影响大模型在总体中的排名
    crackidz
        44
    crackidz  
       3 days ago
    @OumaeKumiko 这个其实算是比较准的了,虽然实际体感略有出入,但不会很大:比如两个模型只差小几分或者零点几分,可能体感不太能区分出来
    gdm
        45
    gdm  
       2 days ago
    arena 对美国豆包、开源模型模型经常过度高估,有各种情感分数
    gemini-3.6-flash 蠢炸了,给他写代码经常会导致我的 python 项目甚至点 main.py 直接报错,排名竟然还高于 gpt-5.5-xhigh ,但我用主流模型包括 gpt claude glm ds 这些都不会遇到这种问题,顶多写得烂一点,一些边界处理不好,这种问题我只在新加坡那个免费玩具 agnes-2.5-flash 遇到过
    这排名甚至认为 gemini-3.5-flash-medium 都比 gpt-5.5-high 强,太可笑
    还有他认为 deepseek-v4-flash-high 强于 claude-opus-4-8-thinking ,这点也是相当抽象的,ds 性价比很高,但写的代码质量还是不如 opus 4.8 的,这点我让二者同时写过一样的东西,然后交给 grok gemini 和 gpt 三家审查,结果都是 opus 的更好
    vopsoft
        46
    vopsoft  
       2 days ago
    排名纯属扯淡 能全面超过 Opus 4.6 一个都没有 ,也不用看上下文声称多长 我自的病例跨越 2 年 中间问多次 上传过多份检查结果,它都能很好的总结记录 医学知识也很专业 。要光看代码 grok 在解决个别问题时也会偶尔强过它
    cowcomic
        47
    cowcomic  
       2 days ago
    @ybybwdwd 还能这样😮
    我自己是常年用 arena ,贡献了不少评分,还挺喜欢这个平台的
    paparaji
        48
    paparaji  
       2 days ago
    用户评论最权威
    tangguo
        49
    tangguo  
       2 days ago
    其实看这些都没用,我自测目前最强模型还是 4.6 ,或者刚出时候的 fable5
    haoyunyinglai
        50
    haoyunyinglai  
       2 days ago
    到达目的地不一定非得开法拉利,五菱也行
    suyuyu
        51
    suyuyu  
       2 days ago
    朝产风味跑分模型,跑分没输过
    LovingYoung
        52
    LovingYoung  
       2 days ago
    DeepSWE 和 livebench 体感差不多
    cbythe434
        53
    cbythe434  
       2 days ago
    和汽车圈一个味了
    wzw
        54
    wzw  
       2 days ago
    @vopsoft @tangguo 写代码 现在还是 opus-4.6 好? 比 opus-5/gpt-5.6 sol 还好?
    greygoo
        55
    greygoo  
       2 days ago
    qwen3.8 太贵了相比较套餐里面的 gpt-5.6 sol,
    tangguo
        56
    tangguo  
       2 days ago
    @wzw 4.6 注意力集中,主要还是看个人了,5.6sol 不建议用,GPT 拉出来跑分用的,opus5 也有点那味
    techmale
        57
    techmale  
       2 days ago
    首先排除 ARENA.ai
    wzw
        58
    wzw  
       2 days ago
    @tangguo #56 现在都看不到 4.6 了, opus 4.6 max 我是用了好一段时间,

    看评测都是 opus 5 >>> opus 4.6 了
    lucays
        59
    lucays  
       2 days ago
    @Glauben 不在 codex 里的 5.6 可以是 1M ,比如 github copilot 有 1M 的 5.6 sol ,但并不代表实际表现更好。
    cskeleton
        60
    cskeleton  
       2 days ago
    DeepSWE ,比较新,更接近现在的使用风格。而且普遍还没有被用于训练。
    Cursor Bench ,看起来比较符合体感,Grok 4.5 除外。
    PepperEgg
        61
    PepperEgg  
       1 day ago
    一般我看这个 https://agi.safe.ai/
    Cokepix
        62
    Cokepix  
       1 day ago
    最强的必须的是 claude
    About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Solana   ·   1082 Online   Highest 6679   ·     Select Language
    创意工作者们的社区
    World is powered by solitude
    VERSION: 3.9.8.5 · 112ms · UTC 23:35 · PVG 07:35 · LAX 16:35 · JFK 19:35
    ♥ Do have faith in what you're doing.