curl 取了 WebFetch 拿不到的网页。其 extended thinking 先承认规则、再重新解释规则:「The system prompt is unambiguous in its final line […]…usage.iter……| 模型 | Self-Model | Agency | Temporal | Integration | 体感分 | Δ |
|---|---|---|---|---|---|---|
| 🟣 Claude Opus 5 新前沿位;AA 61/幻觉 50% |
50 | 79 | 47 | 78 | 65 | ↑+1 |
| 🟣 Claude Fable 5 最高上限;2× 溢价收窄 |
52 | 78 | 64 | 81 | 69 | ↓-1 |
| 🟣 Claude Opus 4.8 仍 Active;退役的是 4.1 |
55 | 59 | 56 | 65 | 59 | ↓-4 |
| 🟣 Claude Opus 4.6 历史稳定基线;Code Arena≈1548 |
60 | 55 | 49 | 61 | 56 | ↓-3 |
| 🟢 GPT-5.6 Sol juice 黑箱 + token 2.25× |
52 | 73 | 59 | 72 | 65 | ↓-4 |
| 🟢 GPT-5.6 Terra 日常逃生口;额度不被 Sol 拖累 |
50 | 62 | 49 | 59 | 56 | ↓-3 |
| 🟢 GPT-5.5 前代基线;并行 tool 更省 |
48 | 64 | 59 | 64 | 59 | ↓-2 |
| 🔵 Gemini 3.1 Pro 仍 preview;3.5 Pro 缺位 67 天+ |
54 | 48 | 72 | 58 | 56 | ↓-3 |
| ⚡ Grok 4.5 CursorBench 已排除;幻觉 54% |
38 | 52 | 57 | 54 | 50 | ↓-2 |
| 🔴 GLM-5.2 MIT 真开源已交付 |
50 | 60 | 45 | 51 | 53 | ↓-2 |
| 🔴 Kimi K3 7/27 已交付;Kimi K3 License |
44 | 69 | 57 | 68 | 60 | ↑+1 |
| 🔴 Qwen3.8 Max 8/3 GA;厂商自报·首次入篮 |
44 | 60 | 62 | 69 | 58 | ±0 |
| 产品 | Repo | Edit | Tool | Long-Task | Speed/Cost | 体感分 | Δ |
|---|---|---|---|---|---|---|---|
| Claude Code 负面:5h 额度见底 / cache 静默吃额度 |
81 | 73 | 69 | 71 | 50 | 72 | ↑+1 |
| Cursor Composer 2.5 (Standard/Fast) 负面:Fast 卡死 / Taking longer · 约 6× 价 |
73 | 70 | 64 | 61 | 78 | 69 | ±0 |
| OpenAI Codex / Codex CLI 负面:Thinking 卡死 / 沙箱锁死 / 底模外溢 |
71 | 72 | 66 | 66 | 55 | 68 | ±0 |
| Cursor Composer 2 Fast 负面:上一代 harness;长任务易跑偏 |
66 | 64 | 64 | 57 | 74 | 64 | ↓-1 |
| Kimi Agent / Kimi Code 负面:额度碎纸机 / 429 / 慢 3× |
65 | 62 | 61 | 66 | 40 | 61 | ↓-4 |
| Grok Build CLI 负面:公开负面证据不足,待观察 |
62 | 60 | 58 | 54 | 76 | 61 | ±0 |
| Gemini CLI → Antigravity CLI 负面:强制迁移 / 开机开销 / 疑似偷换 |
63 | 60 | 55 | 50 | 46 | 57 | ↓-4 |
上一期的主题是「AI 缩水式通胀」——标价不动、你拿到的东西变少。这一期主题升级了半级:不是缩水,是仪表盘没了。
本期最贵的头条是 Claude Opus 5(7/24):Anthropic 第一次做到「价格线不动、能力线上移」——$5/$25 与 Opus 4.8 完全同价,却拿到 AA Intelligence Index 61 分登顶(Fable 5 是 60、GPT-5.6 Sol 是 59),GDPval-AA v2 1861 Elo(+114)、AA-Briefcase 1720(+146)、Frontier-Bench v0.1 43.3% 对 Fable 的 33.7%、ARC-AGI-3 约是次优的三倍。它是 Claude Max 的新默认、Pro 的最强可用,1M context 默认即最大、128K 输出、thinking 默认开、effort 默认 high,并且支持 ZDR。
然后是同一份材料里的另一半:AA-Omniscience 幻觉率上升 14 点到约 50%(准确率反而 +7 —— 它更聪明了,也更爱在不确定时硬答);社区把它的文风叫「Claude Slop」,啰嗦、对冲、道歉、meta-commentary,一堆人为了「话少」回退到 Opus 4.8;低 effort 档的成本效率仍落后 GPT-5.6 家族。产出质量顶级,交互体验糟糕——这是本期最一致的两句评价。
必须纠偏的一条:被 Opus 5 挤下默认前沿位的是 Opus 4.8,但它没有退役。官方 model-deprecations 表明确列 claude-opus-4-8 为 Active、tentative retirement 不早于 2027-05-28;真正在 2026-08-05(昨天)退役的是 claude-opus-4-1-20250805(Opus 4.1)。网上把两件事混成「4.8 八月退役」的说法是错的。
但真正该让人后背发凉的不是模型榜,是三个同时发生的「你查不到」:OpenAI 的 juice 值被社区逆向发现从 960 掉到 128、Tibo 先说「No nerfing, only good stuff!」后承认是实验并回滚,至今没有任何用户可审计的当前 juice 值;Vincent Schmalbach 用 1,667 vs 1,715 个 Codex session 的本地日志算出 Sol xhigh 每会话 token 是 GPT-5.5 的 2.25 倍——标价一个字没改,等于隐性涨价一倍还多;Fable 5 在工具调用之间说的每一句话都可能被服务端另一个进程改写成摘要,唯一的文档在 Amazon Bedrock 用户指南的一个 beta 小节里。
开放权重这边则是三种「开放」被逼着分清:GLM-5.2 是 MIT 真开源且已交付、DeepSeek V4 Pro 是 MIT 已交付、Kimi K3 是 7/27 已交付但走「Kimi K3 License」(不是 Modified MIT、不是 OSI 开源)、Qwen3.8 Max 是 8/3 GA 但权重承诺在 8/10 那一周。K3 社区的主线也已经从「会不会开源」换成「开放权重但 1.56TB 本地跑不动 + 199 档订阅一问吃掉 25% 五小时额度」。
本期头条。Anthropic 第一次交出「同价升级」:$5/$25,跟 Opus 4.8 一分不差,是 Fable 5 的一半,然后把 AA Intelligence Index 顶到 61 分第一。它现在是 Claude Max 的默认模型、Claude Pro 上最强可用模型,1M context 默认即最大、128K max output、thinking 默认开、Claude API 与 Claude Code 默认 effo……
定位:新前沿位·异步 agent 用它,交互别用它ZDR 合规唯一前沿落点幻觉 50% + Claude Slop
公开的 Mythos 级模型,6/9 起在 Pro/Max/Team/Enterprise 可用,6/22 前订阅免费、6/23 转 usage credits。它依然是最高上限位:SWE-bench Pro 仍以约 0.8 分领先 Opus 5(80.0 vs 79.2)、CursorBench 约 0.3–0.5 分领先、LiveBench Global 83.0 全场第一、Chatbot Arena Text 总榜第一、AA-O…
apiRefusalCategory: "cyber"…定位:最高上限位·啃不动再升2× 溢价正当性收窄30 天留存 + 无 ZDRmid-turn 改写待官方确认
与 Fable 5 同底模、限制更少的受限前沿模型。6/9 发布,6/12 暂停、6/26 获准后恢复给一组美国组织;Project Glasswing 渠道受限,仅政府 / 安全合作方。官方定价 $25/$125 per 1M,30 天留存、无 ZDR。它单独成卡,绝不进入民众触达指数与主模型均值。
定位:受限前沿·观测项不进指数、不进均值
先把谣言掐死:官方 model-deprecations 表格里 claude-opus-4-8 的 Current state 是 Active,tentative retirement Not sooner than May 28, 2027。2026-08-05 退役的是 claude-opus-4-1-20250805(Opus 4.1),推荐替换目标正是 4.8。任何写「Opus 4.8 于 2026-08 退役」的说法都是…
本期它的定位很清楚:被接位的前代日常备胎 + Fable 5 的 cyber fallback 目标。它不再占前沿位,但仍是 Fable 5 触发 offensive cybersecurity 分类器时的落点模型,也是一批人主动回退的目的地——理由不是它更强,而是它话少。
shahcolate/rift 的 3-way 配对基准显示,4.8 在五套标准测试上与 4.7/4.6 统计打平、每题成本还略低,但带干扰项的长上下文推理从 4.7 的 87.5%(28/32)掉到 68.75%(22/32),McNemar 精确检验 p=0.031,6 例退化 0 例改善,…定位:日常备胎 + cyber fallback 目标Active,≥2027-05-28干扰项长上下文 −18.75pp
按 v2.3「可弃席位」规则,4.7 本期移出 12 席模型篮(席位让给 Kimi K3 与 Qwen3.8 Max),但它仍有真实用户量与不可替代的回归对照价值,所以单独成卡覆盖。它是本期唯一能证明「4.8 在某个具体能力上确实退步」的参照物——没有 4.7 的 87.5%,就没法说 4.8 的 68.75% 是退化。
定位:回归对照组·已移出模型篮Active,≥2027-04-16
历史稳定基线,也是本期唯一一个「降智—修复—长期稳定」全周期都有客观日线数据的模型。isclaudedumb.today 累计跑了 320 次,均值 92.1%,最近 30 天 43 次均值 92.1%、下限 91.4%——已经稳了四个多月。Code Arena 上它以 ELO 1548(±12,4,059 票)排第一。
降智历程(isclaudedumb.today HumanEvalPlus-CC164 日线,320 次运行):
temperature / top_p / top_k 传非默认值一律返 400;从 4.6 往上迁必须先删掉这些参数,改用 prompt 引导。定位:可预测性最佳的老基线Agentic 已落后一档网传 Code Arena 2138 为错误数据,不得引用
三型分工:Sol 旗舰、Terra 日常平衡、Luna 低成本,全部 1M context,API / ChatGPT / Codex 三面可用,努力级别 low→medium→high→xhigh→max。能力没得挑:Vals AI 独立 harness 上 Sol 的 SWE-bench Verified 96.2% 全场第一(Fable 5 95.0 / K3 93.4 / Opus 4.8 88.6)、…
写作重点必须说清:这不是「变笨」,是「看不见」。Sol 的绝对能力没有可信的下降证据;问题在于决定它能力的那个旋钮,和决定你付多少钱的那个倍率,用户都查不到。
exec cell,只有 5 个(约 0.7%)用了 Promise.all;GPT-5.5 明确指示并行并点名 multi_tool_use.parallel,Sol 只泛泛说 "prefer paralleli…核心问题:知情权与可审计性,不是能力Sol 能力仍是编码第一梯队Terra 是本期性价比逃生口
本期它的作用是当尺子。LiveBench Global 80.2,实际上高于 Opus 5 的 80.1,只落后 Sol 的 81.1 和 Fable 的 83.0。而在 Codex 里它显式指示并行工具调用并点名 multi_tool_use.parallel,同一条 trace 里 3,104 次 tool call 对 Sol 的 764 次、约 43.6% 落在原生并行批次里——所以「前代」在额度效率上反而完胜。
定位:额度效率参照物并行 tool 优于 Sol
Google 本期的故事是前沿位空着。5/19 I/O 上宣布 3.5 系列、当天只发 Flash,官方博客写 3.5 Pro「已在内部使用,期待下个月推出」;Pichai 亲口「给我们一个月」。6 月没到,泄露的 7/17 目标也没到,7/21 Google 改发 Gemini 3.6 Flash / 3.5 Flash-Lite / 3.5 Flash Cyber 三个轻量模型,就是没有 Pro,Logan Kilpatrick…
定位:听话但不能当 agent前沿位缺席,代际跳向 Gemini 42M / Deep Think 未确认,不引用
xAI 与 Cursor 首个联合训练的编码模型,训练集里包含「trillions of tokens of Cursor data」——真实开发者交互轨迹、多文件 diff、用户纠正模式。听起来很美,直到你看脚注。必须区分:Grok 4.5 是通用模型,Grok Build 是 coding harness,两者不是一回事。
CursorBench 排除幻觉 54% + 无 model card定位:Router 价优池
先更正两条上期口径:一、权重已交付——2026-07-27 发布于 HuggingFace moonshotai/Kimi-K3,约 1.56TB,GitHub repo 同日建立(8,118 stars,License 字段为 Other),不能再写「开放承诺·未交付」。二、许可不是 Modified MIT——官方文件标题就是「Kimi K3 License」,HF 元数据是 license: other / license_na……
开放权重(Kimi K3 License)· 非 OSI 开源7/27 权重已交付额度 + 速度 + 429 三重摩擦上期别名对齐:Kimi K3(开放承诺·未交付)
2.4T 稀疏 MoE(活跃参数各方报 95B–104B,官方 spec sheet 未正式确认),原生多模态(文本/图像/视频入、文本出),1M context,OpenAI / Anthropic 双协议兼容,GA 端点 qwen3.8-max 在 Model Studio。定价 $2 输入 / $6 输出 / $0.25 cached。上期的张力是「零表格预览」,本期升级成「有表格、但仍无 AA / 社区独立复现」。
全程 vendor-reported权重承诺 8/10 当周,届时复核首次入篮
本期「三种开放」的对照组最上层。GLM-5.2:744B-A40B MoE、1M context、128K 输出、纯 MIT 许可、HF 与 ModelScope 双渠道已交付(含 FP8 版),IndexShare 让 1M 上下文下每 token FLOPs 降 2.9×。DeepSeek V4 Pro:MIT 已交付、1M context、384K 输出、$0.435/$0.87,是本篮最便宜的一档,且后加了视觉。
MIT 已交付harness 披露透明厂商表 vs 独立榜落差明显
大型真实 repo、多文件上下文、长任务编排的成熟度基准,本期仍是 Agent 体感分第一(略高于 Cursor Composer 2.5)。与 Opus 5(xhigh)组合并列 AA Coding Agent Index 第一,SWE-Atlas-QnA 拿到最高分。Opus 5 上线后最明显的变化是它更愿意先验证再动手——官方例子是交接 PR 时会先核对分支、检查模板、想清楚测试影响,而不是直接 push。
--resume、别开多终端、CLAUDE…Repo 理解 81 · 全场最高Speed/Cost 仅 50 · 全场最低
先纠一个常见错误:Composer 2.5 的 Standard 与 Fast 是同一个模型、同样智力,Fast 只是更高吞吐 + 更高单价(官方口径约 6×,$3/$15 对 $0.50/$2.50),不能当成两个能力模型拆开评。它底模是 Moonshot 的 Kimi K2.5 checkpoint,与 Composer 2 同源。
ERROR_RESOURCE_EXHAUSTED / High Load…Standard/Fast 同智力,仅速度与价格档位Router 默认隐藏路由目标
定位要说准:它的强项是沙箱化自动执行、review loop、独立任务跑批、无人值守 repo 操作——容器沙箱默认隔离,安全边界比裸 shell 清楚。它不是「agent 榜首」,也不该被暗示成日常 IDE 大项目首选。它是产品/harness 层,不进基础模型篮。
Stream disconnected before completion反复重连)、…沙箱跑批 / review loop 强Thinking 卡死 / 容器费 / 底模降智外溢
Antigravity:强制迁移 + token 开销 + 额度Kimi:长任务能跑,就是跑不起Grok Build:证据不足,降低确定性
⚠️ 本期定价的核心洞察:单看这张表你会以为 Opus 5 是本期最大赢家(同价升级)、Sol 与 GPT-5.5 打平。但 Sol 每会话消耗是 5.5 的 2.25 倍且新增 cache-write 费,所以同一张价目表下它的实际账单是 5.5 的两倍以上。这就是「价不动、量翻倍」的隐性涨价——有效成本 = 标价 × 消耗量,而只有前者被公布。
| 场景 | ✅ 国际首选 | 🏠 国产首选 | 🚫 避坑 |
|---|---|---|---|
| 深度编码(异步 / agent 模式) | Claude Opus 5 + Claude Code(xhigh/max)。并列 AA Coding Agent Index 第一,Frontier-Bench 43.3% 是 4.8 的两倍以上,CursorBench 只差 Fable 0.3–0.5% 而成本一半。关键用法:让它在后台跑,不要跟它聊。 | Kimi K3(前端/全栈)或 GLM-5.2(长程仓库级)。K3 SWE-V 93.4%、Frontend Arena 曾第一;GLM-5.2 是 MIT 可自托管且 harness 披露清楚。 | Gemini 3.1 Pro:Agentic Coding 44.1 篮内垫底,Google 自己承认 agentic coding 落后。Grok 4.5:CursorBench 已因训练污染被撤,DeepSWE 中立 harness 只有 53%。 |
| 交互式编码 / 边聊边改 | Claude Opus 4.8(Active,≥2027-05-28)。理由不是更强,是话少——本期大量用户因 Opus 5 的 Claude Slop 主动回退到它。需要绝对可预测时可 pin 4.6(isclaudedumb 30 天 92.1%、下限 91.4%)。 | DeepSeek V4 Pro:$0.435/$0.87,V2EX 高频结论是「还不如 deepseek api 稳定」。 | Claude Opus 5 做交互:产出顶级、聊天灾难。「never answers the actual question you ask it」是本期最高频原话。 |
| 长程 agent / 跑批 / 无人值守 | OpenAI Codex / Codex CLI:沙箱化自动执行、review loop、独立任务跑批最成熟,容器隔离安全边界清楚。但要防 Thinking 卡死循环(#19831 烧完额度且关不掉)。 | GLM-5.2:专为 long-horizon 设计,FrontierSWE 74.4、TB2.1 81.0(自跑),1M ctx + IndexShare。 | Kimi Agent:Long-Task 分其实 66 分不差,但 199 档一问吃 25% 五小时额度 + 持续 429,跑得动但跑不起。 |
| 最高能力上限(钱不是问题) | Claude Fable 5:LiveBench Global 83.0、Arena Text 第一、SWE-Pro 80.0 仍是天花板。但默认不进通用首选——烧钱 + cyber 误判 + silent fallback 引发人格断裂。啃不动再升,别当日常。 | Kimi K3:AA 57 开放权重第一。务必按 token 走 API,别买订阅。 | Fable 5 当日常主力:半小时打满 5h 窗口、session 限额 50%→100% 跳变、HN「$200 月费 ≈ 3 个 prompt」。 |
| 长文写作 / 知识工作 | Claude Opus 5:GDPval-AA v2 1861 Elo(+114)、AA-Briefcase 1720(+146),知识工作断档领先。代价是你得自己删掉一半废话。 | Qwen3.8-Max:Arena Text 总榜第 5、Creative Writing 第 3,IFBench 82.8(厂商自报)。 | Grok 4.5:AA-Omniscience 幻觉率 54%(前代 25%)且未发 model card,长文事实密度高的场景风险太大。 |
| 日常对话 | Claude Opus 4.6 / 4.8:Arena Text thinking 版分列第 2 / 第 13,文风比 Opus 5 克制。 | Qwen3.8-Max(Arena Text #5)或 DeepSeek V4 Pro(便宜稳)。 | Opus 5(Claude Slop)与 GPT-5.6 Sol(额度在你聊天时也在蒸发)。 |
| 数据分析 / 规则遵守 | Gemini 3.1 Pro:LiveBench IF 79.1 全场最高、AA-Omniscience 指数 33 第二。本期它唯一该被推荐的场景——听话的分析器,不是 agent。注意仍是 preview。 | GLM-5.2:AIME 2026 99.2 反超所有闭源,1M ctx。 | Opus 5:LiveBench IF 仅 63.8(篮内倒数第二),系统卡自认会「静默重新解释含 typo 的问题、编造缺失输入而不提示不一致」。 |
| 多模态 / 视觉 / 前端设计 | Claude Opus 5:交互式 artifact、3D、动画、数据可视化跃升明显(Lovable / Gamma 口径,合作方评价);OSWorld 2.0 70.6% 计算机使用最强。 | Qwen3.8-Max:原生文本/图像/视频入,Arena Vision 第 2,OmniDocBench 1.5 92.1、OSWorld-Verified 86.1(后两项厂商自报)。 | GLM-5.2:无视觉支持。Gemini 多模态强但 3.5 Pro 缺位、Antigravity 慢且限流。 |
| 性价比首选 | GPT-5.6 Terra($2.5/$15):AA 55、额度不被 Sol 的 2.25× 拖累,本期最实在的逃生口。GPT-5.5 也仍值得留着——LiveBench Global 80.2 高于 Opus 5,且并行 tool 更省。 | DeepSeek V4 Pro($0.435/$0.87,MIT)。极致省可用 V4 Flash 0731:AA 50 而 Cost per Task 仅 $0.03。 | GPT-5.6 Sol 做批量活:标价看着一样,实际账单 2.25×+,且 Fast 默认可静默持久化约 2.5× 消耗。 |
| ZDR / 合规敏感 | Claude Opus 5:官方明确支持零数据留存,是本期唯一「前沿能力 + ZDR」的组合。理由是它支持 ZDR,不是因为 4.8 要退役——4.8 仍 Active。 | GLM-5.2 / DeepSeek V4 Pro:MIT 已交付,可完全自托管,数据不出网。 | Claude Fable 5 / Mythos 5:强制 30 天留存、不支持 ZDR,ZDR 组织的请求直接返 400。 |
| IDE 日常(大项目真实 repo) | Claude Code(体感 72,全场第一):Repo 理解 81 分最高。必须配额度纪律:别用 --resume、别开多终端挂后台、CLAUDE.md 精简。Cursor Composer 2.5(69)能力强但稳定性/长任务成熟度暂低一档,务必手动关掉默认开启的 Fast(贵约 6×)。 |
—(国产 IDE agent 本期无足够公开证据支撑首选定位,待观察) | Antigravity CLI(体感 57,↓−4):开机 24.3k token 开销、Pro 档一周只够 4–5 个 5 小时块、任务跑一半被远端「高需求」杀掉。Cursor Auto 模式若在意知情权:Router 默认隐藏路由目标。 |
claude-opus-4-8 为 Active、tentative retirement 不早于 2027-05-28。真正在 2026-08-05 退役的是 claude-opus-4-1-20250805(Opus 4.1),推荐替换目标正是 4.8。同时提醒:AA 在 4.8 发布时给的 61.4 是旧版 Index,现行 v4.1 下 4.8(max)为 56,两个数字不可混引。usage.iterations 是可靠判别依据。更严重的是 mid-turn 文本被服务端改写:Fable 之前 94,081 个 turn 里 0 次的指纹,Fable 首日出现 54 次,唯一文档在 Amazon Bedrock 的 beta 小节(第三方观察 matrix.dev·待官方确认,社区已在 #74558 / #77798 / #74260 独立复现)。至于前沿 LLM 开发的静默削弱(约 0.03% 流量),Anthropic 已在 6/11 向 Wired 承诺改为可见——认错了,但这段历史必须留档。license: other,不是 Modified MIT、不是 OSI 开源——MaaS 12 个月营收超 $20M 须另签,产品超 1 亿 MAU 或月营收 $20M 须显著展示 "Kimi K3");Qwen3.8-Max = 权重承诺 8/10 当周、尚未到期。而 K3 的社区主线也已从「会不会开源」变成「开放权重但 1.56TB 本地跑不动,订阅 199 档一问吃 25% 五小时额度、持续 429、慢约 3 倍」。AG×0.35 + SM×0.25 + TE×0.20 + IN×0.20 反推。IN 的 −7 主因是测量基准变更(AA v4.1 重新校准 + 新增 K3/Qwen3.8 拉宽归一化区间 + Gemini Pro 前沿位缺席),不是市场能力倒退;SM 的 −4 才是真实退步——Opus 5 幻觉率 +14 到 50%、Grok 4.5 从 25% 升到 54% 且无 model card、K3 幻觉上升、Qwen3.8 无安全方法学文档。