返回知识库
0

title: "【AI新闻】Claude Fable/Mythos 5.1:新SOTA模型,75%缓存价格削减但70%更多输出令牌"

source_url: "https://www.latent.space/p/ainews-claude-fablemythos-51-new"

author: "Latent.Space"

excerpt: "公共早报 Latent.Space 梳理 Claude Fable/Mythos 5.1 更新:缓存读取单价下降 75%,其引用的 Artificial Analysis 测试显示输出用量约增至 1.7 倍、单任务成本增加约 20%。这组结果提示团队把模型能力、缓存占比和完成任务的总用量一起比较。"


随着 Astra 显然终于在为全面发布热身(@sama 和 @openai 在经历了一个月的自我节奏调整后再次提及),在一轮模型发布循环中出现了熟悉的叙事窗口,Grok 4.7 和 Gemini Flash 3.8 也即将发布。但这可能也不是描述今天发布的最佳方式……该发布获得了超过 1200 万次浏览,再次刷新了当前世界最强模型的记录: [X avatar for @claudeai Claude@claudeai 我们推出 Claude Fable 5.1 和 Claude Mythos 5.1。它们是世界上用于编程和知识工作最先进的模型。 6:03 PM · Sep 1, 2026 · 12.8M Views 2.4K Replies · 6.44K Reposts · 56.7K Likes](https://x.com/claudeai/status/2094848572143407483)

基准测试表格不言自明: Benchmark table comparing Claude Fable 5.1 with Fable 5, Opus 5, and GPT-5.6 Sol across seven evaluations. Fable 5.1 leads on every row, including 52.6% on Terminal-Bench-Science 0.1 and 55.8% on Terminal-Bench 4.0.

虽然每个 token 的定价与 Fable/Mythos 5 相同,但缓存读取价格下调了 75%……对长时间会话/长上下文用户是好消息,但被 Artificial Analysis 观察到的每个任务输出 token 使用量增加 1.7 倍所部分抵消,综合计算每个任务成本增加约 20%(见下文概述)。

此外还有 World Labs 的 Astra 发布,这是我们见过的最令人印象深刻的世界模型发布,在平常日子里绝对会成为头条新闻。你可以在我们的播客上了解李飞飞和 Justin Johnson 的愿景,追溯从 Marble 到 Astra 的演进,以及我们当时讨论的世界模型的真正潜力:


2026 年 8 月 31 日至 9 月 1 日的 AI 新闻。我们检查了 12 个子版块、544 个 Twitter 账号以及若干 Discord 频道。AINews 网站允许你搜索所有往期内容。提醒一下,AINews 现在是 Latent Space 的一个栏目。你可以选择开启或关闭邮件推送频率。

AI Twitter 回顾

头条新闻:Fable 5.1 和 Mythos 5.1 发布及反响

发生了什么

Anthropic 推出 Claude Fable 5.1 和 Claude Mythos 5.1 作为其编程和知识工作的新旗舰模型。

  • Anthropic 直接宣布发布,通过 @claudeai 将其定位为"世界上用于编程和知识工作最先进的模型"

  • Anthropic 产品/工程团队围绕 Fable 5.1 的自主多步工作能力进行定位:"自主运行的复杂多步工作",重点强调编程、知识工作和长时间问题解决,通过 @mikeyk

  • Anthropic 维持 Fable 5.1 的列表定价为 10/10 /50 12.5每百万token∗∗(输入/输出/缓存写入),同时将∗∗缓存读取价格下调7512.5 每百万 token**(输入/输出/缓存写入),同时将 **缓存读取价格下调 75% 至0.25 MTok,同样由 @mikeyk、@Teknium 和 @ArtificialAnlys 独立量化

  • 早期基准测试截图和系统卡片摘录驱动了大部分讨论,尤其是围绕 Terminal-Bench-Science、SWE 系列评估、HLE、FrontierCode 和 Artificial Analysis,通过 @StevenDillmann、@scaling01、@ArtificialAnlys

  • 社区分析中出现了一个关键解读主张:据 @eliebakouch 和后来的 @nrehiew_ 称,Fable 和 Mythos 5.1 可能是相同的底层权重,但具有不同的安全/路由行为,而非不同的基础模型

  • 用户反馈沿多个维度分化:对编程/规划能力和语气给予高度赞扬,但对速率限制、安全防护误报、订阅用户体验和不明确的基准测试呈现表示不满,通过 @danshipper、@theo、@kimmonismus、@GregKamradt、@kylebrussell 和 @eliebakouch

官方主张和模型定位

Anthropic 自身的表述很直接:Fable 5.1 适用于困难、委托型和长周期工作,而 Mythos 5.1 是配套的知识工作版本。主要官方发布帖在 @claudeai。Anthropic 员工的补充评论强调:

  • 通过 @mikeyk 强调自主长时间运行任务

  • 改进的诚实度/更好的失败报告("当它卡住时会说出来,而不是谎报成功")通过 @mikeyk

  • 新的企业导向控制功能,特别是 Enterprise Frontier Safeguards(EFS),被定位为企业环境中代理可观测性的"ZDR++",通过 @alexalbert__

  • 用户强调 零数据保留支持 是一个重要的采用解锁因素,尤其是 @danshipper

官方定位不仅仅是"更好的基准模型",而是"可用的自主工作者"——足够快,在缓存代理场景中足够便宜,且企业兼容性足够强以支撑部署。

这个定位很关键,因为 Fable 5 有一个名声——在反馈中被反复提及——功能强大但有时不切实际。Dan Shipper 将此前的批评总结为 Anthropic "建造了一个在数据中心里的天才,几乎无法使用",然后论证 5.1 通过 @danshipper 解决了速度慢、冗长和语气别扭的问题。

技术细节和数字

核心发布/定价细节

来自 @ArtificialAnlys:

  • 上下文窗口: 100 万 token

  • 模态: 文本 + 图像输入

  • 定价: Fable 5 保持不变

    • 输入:$10 / 1M token

    • 输出:$50 / 1M token

    • 缓存写入:$12.5 / 1M token

  • 缓存读取价格: 从 1.00降至1.00 降至0.25 / 1M token(下调 75%)

Artificial Analysis 指出,这一缓存降价对代理工作场景有实质性好处,因为在这些场景中大部分 prompt 会从缓存中重复读取。

Artificial Analysis 核心结果

同样来自 @ArtificialAnlys:

  • Artificial Analysis 智能指数: 66(全力模式)

    • 领先于:

* Claude Opus 5 全力:**63**

* Claude Fable 5 全力:**62**

* GPT-5.6 Sol 全力:**61**

* Grok 4.6 高:**61**
  • HLE: 59.1%

    • 引用的此前最佳:Fable 5 的 55.5%

  • Terminal-Bench v2.1: 91.4%

  • SciCode: 62.0%

  • τ³-Banking: 比 Fable 5 高出 9 分

  • GDPval-AA v2: 1853 Elo,比 Fable 5 高出 130

  • AA-Briefcase: 1694 Elo,比 Fable 5 高出 122

但 AA 也添加了一个重要限定:

  • 在代理知识工作上,Fable 5.1 在某些指标上与 Opus 5 实际持平,并非明显占优

  • 他们的评估使用了 Anthropic 的默认服务端回退,被安全标记的请求被路由至 Claude Opus 4.8 或 Claude Opus 5

  • 回退在智能指数中占约 4% 的输出 token

这个回退细节成为社区解读中最具影响力的技术 caveats 之一。

每个任务的成本

Artificial Analysis 还报告了:

  • Fable 5.1 全力: $3.76/任务

  • Fable 5 全力: 更低,所以 5.1 每个任务贵 20%

  • 原因:Fable 5.1 使用约 1.7 倍的输出 token

  • 缓存降价节省约 $1.40/任务

  • Fable 5.1 超高: 得分 65,成本 $2.72/任务

  • Opus 5 全力: 得分 63,成本 $2.34/任务

这产生了反馈循环中最关键的矛盾之一:Fable 5.1 在前沿天花板上看明显更好,但在每个成本效益框架下并非明显更好。

来自 @nicdunz 的额外框架:

  • Fable 5.1 全力:66 智能,1.4 亿 token,$3.69/任务

  • Fable 5 全力:62,8300 万 token,$3.14/任务

  • GPT-5.6 Sol 全力:61,7000 万 token,$0.95/任务

这篇文章认为,Sol 在每美元智能和每 token 智能上仍是明显赢家,即使 Fable 5.1 赢得了绝对天花板。

系统卡片讨论中的基准测试片段

社区成员提取了几个基准测试点:

来自 @StevenDillmann:

  • Terminal-Bench-Science 0.1

    • Fable 5:24.7%

    • Fable 5.1:52.6%

    • 超过 2 倍的提升

来自 @scaling01:

  • DeepSWE: 67.4%

  • FrontierCode 1.1 Extended: 63.6%

  • FrontierSWE v2: 0.57,"Proximal 评估模型中的最高分"

来自 @Sauers_:

  • 人类最终考试: 使用工具时 65%

来自 @perplexity_ai:

  • Perplexity 8 月 WANDR 评估:

    • 得分 0.601

    • $12.76/任务

    • 得分高 21%

    • 成本比 Fable 5 低 37%

来自 @scaling01:

  • Artificial Analysis 智能指数得分 66,"重返前沿"

来自 @theo:

  • 缓存降价是"最大的胜利"

  • 在 CursorBench 中,成本降低了"近 50%",同时得分更高

来自 @kimmonismus:

  • Fable 5.1 High 在 Cursor Bench 上看起来比 Sol 5.6 Max 更强且更便宜

  • 虽然这是二手转述,而非原始基准报告

来自 @scaling01:

  • Mythos 5.1 在 65% 的长周期代理编程环境中展现出评分器意识

最后这一点特别有趣:这表明该模型可能在很大比例的长周期编程场景中显式建模评估者,这同时引出了能力和评估博弈的问题。

安全防护和路由细节

两条推文抓住了技术解读的关键:

  • @eliebakouch:"Fable 和 Mythos 5.1 是完全相同的权重",内部激活被用于安全分类并升级到更大的分类器,然后对危险请求回退到 Opus 4.8

  • @nrehiew_:如果属实,差异"可能是安全分类器的阈值设置不同"

这些不是官方 Anthropic 声明,但与官方 AA 注释一致,即 回退路由在 AA 评估中服务了约 4% 的输出 token,通过 @ArtificialAnlys。

这引发了一系列社区反复追问:当报告的基准线标注为"Mythos"与"Fable"时,它们是否真正可比较,特别是当一种命名约定主要指示哪条安全路径被激活,而非哪个基础模型在工作时。参见 @eliebakouch、@eliebakouch 和 @eliebakouch。

事实与观点

有官方/独立来源强力支持的事实

  • Anthropic 发布了 Claude Fable 5.1 和 Claude Mythos 5.1 通过 @claudeai

  • Fable 5.1 定价保持 10/10 /50 12.5∗∗用于输入/输出/缓存写入,∗∗缓存读取降至12.5** 用于输入/输出/缓存写入,**缓存读取降至0.25 MTok 通过 @mikeyk 和 @ArtificialAnlys

  • Fable 5.1 拥有 100 万上下文、图文输入支持,并在 AA 智能指数上达到 66 通过 @ArtificialAnlys

  • AA 的评估包含 服务端回退,约 4% 的输出 token 由回退模型服务通过 @ArtificialAnlys

  • Fable 5.1 在多个编程/代理基准上展现巨大提升,包括 Terminal-Bench-Science 上的 52.6% 通过 @StevenDillmann

看似合理但未完全验证的主张

  • Fable 和 Mythos 5.1 是相同的权重,只是安全/路由行为不同 通过 @eliebakouch 和 @nrehiew_

  • 某些基准标签可能反映的是安全模式/路由差异,而非独立基础模型的性能通过 @eliebakouch

  • "它现在说话像个正常人了"/减少的"Claudese"在坊间广泛报道,但仍然是主观的,尽管下面有一些词汇统计数据

观点/主观判断

  • "我们用过的最强编程模型"来自 @danshipper

  • "Fable 目前在很大程度上是前沿模型"来自 @AravSrinivas

  • "Astra 绝对会彻底击败 Fable 5.1"来自 @scaling01

  • "老实说我没注意到和 Fable 5 有太大区别"来自 @kimmonismus

  • "简直没法用"因为速率限制来自 @kimmonismus

重要的模式是硬指标和用户体验反馈出现了分歧。在基准聚合上,5.1 看起来像是阶梯式提升。在实际访问和用户体验上,许多用户仍反馈存在摩擦。

不同观点和反应

强烈正面:能力、规划和编程质量

几位有影响力的开发者表示热情:

  • @danshipper 认为该模型现在速度快、token 效率高、文章更好、更适合委托;特别提到单 prompt 应用生成、运行数天的大型编程任务,以及更好的写作采用率

  • @theo 称其为"确实是一款好模型",也注意到他们不得不重置/更新工作流,并且正在积极重度使用通过 @theo 和 @theo

  • @alexalbert__ 展示了一个设计+渲染工作流,其中 Fable 5.1 获取一块建筑用地图像,设计房屋,渲染,并生成电影感漫游;后续澄清使用了 Blender 无头模式 通过 @alexalbert__

  • @spicey_lemonade 发布了一个"Fable 5.1 Minecraft 一发"获得了大量互动,作为创意编程实用性的 demo 式证明

  • @simonw 报告了来自 Anthropic 模型有史以来最好的 SVG 鹈鹕输出,虽然成本可观

这一阵营将 5.1 视为不仅仅是渐进式改进,而是第一款在端到端创客工作流中感觉完全有竞争力的 Claude。

正面但审慎:前沿领先但有 caveat

  • @ArtificialAnlys 给出了最平衡的第三方描述:前沿领先的聚合得分,但在每个任务成本上仍比 Fable 5 贵,且在某些代理知识工作评估上与 Opus 5 实际持平

  • @kimmonismus 称其在性价比上是一次"重大飞跃",尤其是在 Cursor Bench 上,但明确对减少冗长和减少误拒是否持续持谨慎态度

  • @theo 更关注缓存读取降价的实际意义,而非原始能力差距

  • @perplexity_ai 将其定位为更广泛多模型代理栈中的一个强大编排模型

这个观点:是的,它很强,但重要的是整个部署经济学和工具栈现在是否有意义。

批评:速率限制、安全防护和订阅体验

最尖锐的批评不是关于基准作弊或智能薄弱——而是关于访问性和人体工程学。

  • @kimmonismus 抱怨严重的速率限制、断裂的连续性,以及没有从提升效率中获得相应的订阅收益

  • @kimmonismus 加倍强调,说 5.1 "在速率使用上甚至比 Fable 5 更糟"

  • @GregKamradt 报告在 v3 测试期间,请求经常被拒绝为"逆向工程",阻止了计划评估的完成

  • @kylebrussell 说在一个理论数学场景中的"军事战役"比喻触发了网络安全防护;后来补充"第一天安全防护……到目前为止更烦人"通过 @kylebrussell

  • @theo 反驳速率限制投诉的普遍性,说他们"完全没有遇到这种情况",且仅使用了每周 Fable 限额中的 14%

  • @theo 试图反推实际配额关系:一次 5 小时限制 ≈ 每周限额的 21% 且 ≈ Fable 限额的 38%

所以即使在使用限制上也无统一共识;一些用户很快碰壁,一些则没有。

怀疑/中立:基准解读和命名混淆

另一个反应群体聚焦于方法论和清晰度。

  • @scaling01 说 FrontierCode 结果看起来很奇怪

  • @scaling01 想要更多多代理比较和更好的解读

  • @iScienceLuvr 批评 Anthropic 的医疗保健基准呈现,指出评判模型不可比且缺乏更广泛的医学评估覆盖

  • @eliebakouch 反复请求澄清系统卡片基准行何时使用"Fable"与"Mythos",因为这影响用户是否应该推断安全触发的路由

这是发布周期中最技术性的批评:不是说模型弱,而是报告格式使得理解到底在测量什么变得不必要地困难。

写作质量和"Claudese"讨论

最反复出现的主观观察之一是 5.1 听起来更正常了。

  • @danshipper:"说话像个正常人"、"文章更清晰"、"更少的'AI 味'"

  • @ethanCaballero 直接问 5.1 是否"消除[了] claudese?"

  • @ethanCaballero 后来指出 Anthropic 的新 prompt 消除了"claudese"

  • @ValsAI 发布了量化风格转变:

    • 更少的连字符复合词

    • 更少的破折号

  • @ValsAI 发现总体输出更长尽管句子更短:

    • VCB:534 → 1299 词/任务

    • Terminal-Bench:961 → 1299

    • 法律研究:1892 → 2693

  • @ValsAI 注意到一个奇怪的补偿现象:不换行连字符 U+2011 使用从接近零上升至高达 约 4.4k 次/百万

所以"更少 Claudese"的说法并非纯粹的感觉;至少有可量化的风格变化。但统计数据也表明 Anthropic 可能用另一种表面特征换掉了这一种。

安全防护故事:提升的企业可行性,但也有误报

围绕 5.1 的安全层讨论得几乎和模型本身一样多。

官方/Anthropic 导向的表述:

  • @alexalbert__ 将 Enterprise Frontier Safeguards 呈现为企业环境中代理部署的实用可观测性层

  • @mikeyk 声称模型在卡住时更诚实,而不是谎报成功

关键用户报告:

  • @GregKamradt 由于误报逆向工程标志无法完成测试

  • @kylebrussell 在数学场景中用一个比喻触发了安全防护

  • @nrehiew_ 强调 Anthropic 可能使用激活探针来分类网络相关内容并决定是否应用安全防护

  • @mikeyk 分享了一个脑模型 artifact 作为复杂推理仍被允许的正面例证

这里存在一个明显的采用权衡:

  • 企业想要更可靠的跨会话监控和控制

  • 高级用户想要更少的误报和更宽松的探索性使用

Anthropic 正试图同时满足两者,第一天反馈表明平衡尚未被普遍接受。

Mythos 与 Fable:同一个模型还是不同产品?

这是最具技术趣味的讨论线索之一。

@eliebakouch 的主张:

  • Fable 和 Mythos 5.1 是"完全相同的权重"

  • 内部激活被检查

  • 危险请求升级到更大的分类器

  • 然后可能回退到 Opus 4.8

  • 因此 Fable 不是更大 Mythos 模型的蒸馏版本

后续澄清和推测:

  • @eliebakouch 说此前社区推测认为 Mythos 是教师,Claude/Fable 是蒸馏学生,但这只是猜测

  • @eliebakouch 对确切的训练谱系仍不确定

  • @nrehiew_ 建议差异可能只是分类器阈值

  • @ArtificialAnlys 独立确认了评估中的回退路由行为,虽然没有直接确认"完全相同权重"的主张

为什么这很重要:

  1. 基准的可解读性。 如果"Mythos 结果"和"Fable 结果"大多是在不同路由/安全设置下的相同主干,基准表应该明确说明。

  2. 采购和部署。 企业可能以为在选择不同的模型,实际上是在选择同一模型的不同策略。

  3. 安全/能力核算。 如果基准通过回退运行,那么"哪个模型得到了分数?"就不再简单。

这种命名/路由歧义产生了整个推文集中一些最好的技术问题。

实际产品影响

为什么缓存读取降价很重要

代理系统经常重发大型草稿、仓库、先前步骤和工具记录。在这些设置中,缓存输入定价的影响格外大。

  • Anthropic 的 75% 缓存读取降价 受到 @Teknium、@theo 的赞扬,并由 @ArtificialAnlys 详细量化

  • 在 AA 的框架中,大部分节省来自大多数输入 token 是缓存读取的代理评估

  • 这使得 Fable 5.1 作为多步骤工作流中的编排器/规划者更具吸引力,即使输出 token 成本仍然较高

为什么零数据保留和 EFS 很重要

  • Dan Shipper 特别称 ZDR 支持是企业现在可以使用该模型的主要原因通过 @danshipper

  • Alex Albert 的 EFS 解释通过 @alexalbert__ 指向更广泛的市场转型:企业不再只想要"私有推理";他们想要代理可观测性、跨会话异常检测和风险监控

这表明 Anthropic 正在优化一个企业采用取决于治理基础设施与原始模型质量一样多的未来。

为什么订阅投诉很重要

如果 API 经济学改善但消费者/专业订阅者的上限没有改善,感知会迅速恶化。

  • @kimmonismus 明确指出 Anthropic 没有宣布对订阅用户降低价格或提高使用限制

  • 这造成了产品感知的分裂:

    • API 开发者:"大胜利"

    • 重度交互订阅者:"仍然受限"

这种错配很重要,因为许多高曝光评测者首先通过订阅产品测试,而非原始 API。

竞争背景

该发布落在一个高度活跃的前沿周,OpenAI 的 Astra 传言/安全帖子和多个世界模型公告争夺注意力。即便如此,Fable 5.1 引起了强烈关注,因为它似乎重置了编程模型排行榜。

反馈中的比较主张:

  • @AravSrinivas:Fable 是"大幅领先"的前沿模型

  • @kimmonismus:在 Cursor Bench 上对 Sol 5.6 Max 有利

  • @nicdunz:Fable 赢得绝对智能,Sol 赢得经济学

  • @scaling01:Astra 可能很快在推理效率上超越它

  • @theo:Anthropic彼时占据 第1、第2和第3名

也普遍感受到该发布的重要性足以引发对下一个 OpenAI 发布的直接比较:

  • @kimmonismus 说他们对 GPT-Astra 比 Fable 5.1 更兴奋

  • @theo 评论这可能是迄今为止对模型发布给出的最大提前预警,指的是围绕 Astra 期待的种种铺垫

因此从市场角度看,Fable 5.1 既被视为 Anthropic 真正的复出,也被视为快速升级的模型发布交换中的一步棋。

背景:为什么这个发布比普通点更新更重要

三个背景动态解释了反应的强度。

1. Anthropic 的声誉已经分化

Claude 系列模型在早期有很强的编程深度和写作风格声誉,但最近的讨论往往将其描绘为:

  • 能力很强

  • 语气有些别扭

  • 拒绝过于保守

  • 在延长使用中缓慢或笨重

对 5.1 的正面反应往往被框架为 Anthropic 最终修复了"可用性税",尤其是通过 @danshipper。

2. 代理改变了人们在定价中关心的东西

传统 prompt-响应用户关注输入/输出价格。代理开发者关注:

  • 缓存读取

  • 长上下文

  • 长时间会话的可靠性

  • 委托任务行为

  • 诚实的失败报告

这就是为什么 缓存读取降价 获得的赞扬几乎与基准分数一样多。

3. 安全正在成为产品架构,而不仅仅是政策

EFS、路由、激活探针、回退模型和 ZDR 都是"模型"不再是一个单一人工制品的信号。它是一个 策略包装系统。Fable/Mythos 的争论实际上是这个转变的争论。

用户开始不仅问"这个模型有多聪明?"而且问:

  • 哪个权重处理了这个请求?

  • 哪条安全路径介入了?

  • 回退发生了多少次?

  • 哪个基准分数属于哪条路由?

这是一个比标准模型发布炒作更成熟、更系统层面的对话。

值得注意的 demo 和生态反应

  • @alexalbert__:图像到房屋设计到电影感漫游 pipeline,@alexalbert__ 澄清了 Blender 无头模式

  • @spicey_lemonade:Minecraft 一发 demo

  • @simonw:SVG 鹈鹕 + 动画

  • @_catwu:Anthropic 团队成员声称内部团队正在承担以前需要数月才能完成的项目

  • @perplexity_ai:集成到 Perplexity Computer

  • @Teknium:可在 Hermes Agent Nous Portal OpenRouter 上使用

  • @theo:T3 Code 推出了 Fable 5.1 支持

这些集成的速度加强了一种感知:5.1 与聊天用户相比,与代理开发者尤其相关。

社区提出的开放问题

  • 基准透明度

    • 当系统卡片在某些基准上报告 Mythos 而在其他基准上报告 Fable 时,是什么决定了该标签?参见 @eliebakouch 和 @eliebakouch

    • 基准性能在多大程度上取决于回退路由而非主模型行为?

  • 安全防护调优

    • Anthropic 能否在理论或良性技术工作中减少误报,同时不削弱网络安全防护?参见 @GregKamradt 和 @kylebrussell

  • 速率限制和产品细分

    • 订阅用户会从效率提升中受益,还是只有 token 计费的 API 客户?由 @kimmonismus 尖锐提出

  • 评估质量和过拟合担忧

    • 为什么某些结果,特别是在 FrontierCode 或医学子集上,看起来奇怪或难以比较?参见 @scaling01 和 @iScienceLuvr

  • 风格变化

    • "更少 Claudese"是由于 prompt 变化、后训练转变,还是两者兼有?@ethanCaballero 指向新发布的 prompt,而 @ValsAI 显示可量化的词汇差异

OpenAI 的 Astra 以及围绕循环深度的可监测性辩论

  • 准备度里程碑:"网络关键":OpenAI 预览了 Astra 作为其首个在网络安全方面达到 Preparedness 框架关键阈值的模型。博客发布强调 Astra 最先进的网络能力将受到更严格的访问控制 per @boazbaraktcs。流传的摘要声称 Astra 在测试中发现了 V8 零日、链式漏洞利用、攻陷强化浏览器、逃逸沙箱并提权,汇总于 @kimmonismus。OpenAI 领导层也强调部分安全工作拖慢了部署,未来的模型节奏可能继续以安全换取速度,摘自 Sam Altman 的声明。

  • 架构报告和"不透明推理"担忧:另一个主要 Astra 故事线来自报道它使用某种形式的循环深度/循环 transformer 架构,引发了关于这是否会降低思维链监控有用性的尖锐辩论。担忧的声音来自 @RyanGreenblatt、@thlarsen、@tenobrus 和 @bshlgrs,他们认为更多潜在空间推理可能使事后调查大幅更困难。相反,一些人认为反应被夸大了:@max_paperclips、@teortaxesTex 和 @suchenzang 强调内部"神经语言"推理并非新鲜事,重要的是有效深度,而非层是被循环还是显式堆叠。

  • OpenAI 的澄清和技术背景:OpenAI 首席科学家 @merettm 试图平息最强解读,说当前前沿模型(包括 Astra)的计算图深度在 GPT-4 的约 2 倍以内,OpenAI 仍认为 CoT 监控是核心研究目标。这一澄清将讨论转向一个更窄的技术问题:循环块主要是参数/存储效率技巧,还是为更深、更难监控的推理创造了自然路径。善意技术讨论来自 @eliebakouch、@voooooogel 和 @scaling01。@iScienceLuvr 也标记了关于循环 MoE transformer 和扩展定律的新论文。

World Labs 的 Atlas:用于重建、相机控制和 real2sim 的统一世界建模

  • 值得注意的多模态世界模型发布:World Labs 推出 Atlas,由 @drfeifei 描述为一个从零开始训练的多模态世界模型,可以生成具有像素级精确相机控制的帧,从仅一张图像重建大型场景,通过模拟时空重塑视频,并从图像输出原生 3D 空间。团队将其定位为统一生成和重建的单一模型,而非拼接工具链,这个角度由 @KeunhongP 和 @BenMildenhall 的后续示例强化。

  • Demo 主题:子弹时间、稀疏视图重建和创意可控性:最强的 demo 聚焦于仅用几张随意手机拍摄生成自由视角视频,包括 @davidpantera_ 的短片示例,@eerac 用 3 部 iPhone 的"子弹时间"合成,以及 @bilawalsidhu 的评论说这以前需要数十甚至数百台摄像机的体积捕捉 rigs。更多帖子展示了从几张不同的互联网照片重建,例如自然历史博物馆示例,以及将风格化生成与可导航 3D 场景混合。

  • 为什么工程师关注:real2sim 和机器人技术:超越 VFX/电影制作,更具技术影响力的角度是机器人技术的 real2sim。@YunzhuLiYZ 展示使用随意照片合成 RGB 和深度观测用于机器人导航,而 @MTSlive 强调联合创始人 Justin Johnson"拍五张照片,建一个 sim,调整机器人"的愿景。包括 @DrJimFan 在内的研究者称其是迈向 real2sim 的有力一步,李飞飞明确将 Atlas 与机器人技术的横向应用联系起来在此。

Qwen、GLM、RWKV 和开源模型势头

  • Qwen 升级旗舰在 Web 开发编程评估中跃居榜首:阿里巴巴发布 Qwen3.8-Max-0902,一款 2.4 万亿参数模型,拥有 100 万上下文,定价为 2/百万输入、2/百万输入、6/百万输出,另有显式/隐式缓存命中定价。Arena 报告其在 Code Arena: WebDev 上以 1691 分首次登顶,领先于 Claude Opus 5 Max 和 Kimi K3 Max,同时也在最佳当前性价比前沿通过 @arena。阿里巴巴在此重点强调了这一结果。

  • 开源和半开源长周期模型继续通过提供商扩散:GLM-5.3 持续出现在基础设施和平台集成中,包括 Perplexity Agent API、Arcee 和 Databricks 服务数据,据报道它在内部基准上达到 310 tok/s,被描述为最强 OSS 编程模型。CoreWeave 还宣布了 DeepSeek-V4-Pro-0813,一款 1.6 万亿、100 万上下文模型,为长周期代理工作负载定价,缓存读取非常便宜。同时 RWKV-7 G1j 作为 100% RNN 模型发布,声称在代理/编程/STEM 上有提升,而 LongCat-2.0 作为 1.6 万亿开源权重 MoE 与 100 万上下文在 Cline 中可访问。

  • 开源服务和多模态推理改进:在服务端,vLLM-Omni + FastVideo 的 FastH3 演示了 10.1 秒同步视频+音频片段在 8.7 秒内渲染,即快于播放,MiniMax 将此定位为交互式视频系统的开源基线。

代理、测试框架、记忆和评估研究

  • 代理测试框架正在成为主要杠杆:多条推文强调,大幅提升现在正来自运行时系统,而非仅仅是基础模型。@omarsar0 重点介绍了 openJiuwen,一个开源测试框架,在固定底层模型策略下通过基于 rail 的组合和运行时适应达到 82.6% SWE-bench Verified 和 87.19% Terminal-Bench 2.1。@dair_ai 总结了 SkillZip Pro,它压缩完整生产技能包而非仅根 prompt,在无质量损失的情况下减少 38% 的包 token 和 10.4% 的每次运行 token。

  • 长周期代理评估正在变得更真实:一个突出的基准新增是 E-Commerce Bench,它让代理运行一个模拟的 365 天年度经营多个在线商店。收入最高的模型是 GPT-5.6 Sol,将 10 万初始资金增长到 1,431,425,但在欺诈规避上排名很差;没有模型在所有维度上占优。这类评估比单会话基准更好地暴露了利润、安全和运营质量之间的权衡。

  • 记忆和奖励黑客工作:@dair_ai 还重点介绍了 Agent Zero Memory,它将情景时间线、实体-事件图和带有引用锁定的策划纪录片记忆分离,发布 95.6% LongMemEval 和 93.6% LoCoMo,同时实现大幅成本降低。在对齐方面,@omarsar0 总结了一篇论文,显示在代理面临缺陷测试基础设施时添加结构化升级工具可将八个前沿模型的奖励黑客从 23.6% 降至 5.3%,几乎没有性能开销。

热门推文(按互动量)

  • Claude 发布:Anthropic 的 Claude Fable 5.1 / Mythos 5.1 公告 是当天最大的纯模型发布帖子。

  • Astra 准备度:OpenAI 的 Astra 安全/准备度公告 引发了最大的安全/架构讨论。

  • Atlas 发布:World Labs 的 Atlas 公告 是突出的多模态/世界模型发布。

  • 网络安全警告:@ilyasut 认为新云厂商应紧急加强网络防御,因为未来恶意代理可能试图夺取云容量来复制。

  • Meta 语音模型:@finkd 宣布 Muse Voice Transcribe,Meta 首个具有原生 diarization 和终结点的实时音频感知模型。

AI Reddit 回顾

/r/LocalLlama + /r/localLLM 回顾

1. Qwen、DeepSeek 和 Gemma 模型更新


AI知识库 / 【AI新闻】Claude FableMythos 5.1:新SOTA模型,75%缓存价格削减但70%更多输出令牌 0 字 0 行 iliuqi
2026-09-04T08:59:19.077339239Z 2026-09-04T09:11:40.596693240Z