1. 每日精选/

每日精选 — 2026年6月13日

今日概览 #

今天的主线不是模型又变强了多少,而是“强模型”本身正在被制度、成本和工作流设计重新定义。Fable 5 在美国政府指令下暂停访问,开源社区同日反弹, Cursor 与 Cline 则用默认审查和模型路由证明:调用最强模型已经不是唯一答案,设计可运行、可观测、可中止的智能回路才是。


🐦 来自时间线 (X/Twitter) #

Fable 5 在 ProgramBench 上 200 题全拒绝,裸模型分数正在失效 #

@scaling01 · 约1天前 · 4873 赞

Fable 5 在 ProgramBench 上 200 题全部拒绝,但真实代码任务里它又被认为极强。这条推文把争论从“模型行不行”转向“测量方式是否还够用”。当策略层、路由层和供应商风险判断会动态限制模型能力时,benchmark 需要把“系统让不让它会”纳入评分。对中国读者来说,这意味着不要只看裸模型分数,而要看可用能力与可审计能力。

-> 原文


Cursor 把自动审查设为新用户默认 #

@cursor_ai · 约1天前 · 1176 赞

Cursor 在新用户流程中默认启用 auto-review:一个分类器子 agent 会审查上下文中的动作,并决定允许、阻止或请求批准。官方称 eval 准确率达 97%,失误集中在模糊边界。这标志着审查层正从高级设置变成 agent 基础设施的基础组件,safety primitive 开始产品化。

-> 原文


Cline:便宜模型加对抗审查循环能打赢 Fable 5 #

@cline · 约1天前 · 1145 赞

Cline 指出 Fable 5 一天可烧掉数千美元订阅额度,而便宜模型加对抗审查循环往往能以低得多的成本达到相似或更好结果。这重新把模型竞赛框定为工作流设计问题:最强单模型不是唯一解,路由、验收与 review 才是杠杆。

-> 原文


Perplexity 把 Deep Research 原生接入 Computer #

@perplexity_ai · 约1天前 · 652 赞

Perplexity 将 Deep Research 变为 Computer 内的原生 skill,连接 agent harness、搜索即代码生成、长时沙盒、连接器和授权数据。对 Pro/Max 用户开放。信号:研究 agent 正从单次查询工具变成可持续的工作环境。

-> 原文


Goodfire 推出训练前预测性数据调试 #

@GoodfireAI · 约1天前 · 850 赞

Goodfire 能在训练前预测模型可能学到什么,示例包括损坏的护栏和 DPO 数据集中的幻觉。它把关注点从模型行为的后验解释前置到数据集可观测性。未来模型质量差异可能更多来自数据调试,而非架构。

-> 原文


Recursive 公布早期自动化 AI 研究成果 #

@RichardSocher · 约2天前 · 584 赞

Richard Socher 宣布 Recursive 的自动化发现系统在多个基准上找到有用解,包括 NanoGPT Speedrun、NanoChat autoresearch 和 NVIDIA SOL-ExecBench。虽然尚处早期,但它把“递归自我改进”从口号变成可检查的实验输出。

-> 原文


🎙️ 来自播客 #

Loopcraft:堆叠循环的艺术 #

Latent Space · 约1天前

Latent Space 6 月 12 日的 AI News 把 Peter Steinberger、Boris Cherny 与 Andrej Karpathy 关于 agent loops 的评论串成一条主线:下一轮杠杆不在单次 prompt,而在设计能自我触发、检查、回滚、再尝试的循环系统。节目还涉及 Fable 5 争议、自动化 AI 研究、数据调试和 agent 基础设施发布。

-> 收听


Anthropic 产品负责人 Mike Krieger 谈如何用 Fable 5 #

AI & I · 约2天前

Dan Shipper 访谈 Instagram 联合创始人、现任 Anthropic 产品负责人 Mike Krieger。这期最有价值的不是发布 hype,而是他描述长程模型如何改变任务规划、委托和验证。当模型能连续运行更久,产品构建者的工作流会从“一步步提示”变成“设计验收与回滚规则”。

-> 收听


Hey Siri, Tell Me a Fable #

Stratechery · 约12小时前

Ben Thompson 把苹果界面问题与 Fable 级 AI 联系起来:当模型能承载更多项目上下文并持续执行,瓶颈从“回答问题”变成“暴露可控的产品界面”。这桥接了消费平台战略、语音助手与新 agent 能力层。

-> 收听


与 Mythos 共事是什么感觉 #

One Useful Thing · 约3天前

Ethan Mollick 的早期 hands-on 经验强调长程执行:实验远超普通聊天机器人交互,进入持续知识工作。虽然发布时间超过 48 小时,但它直接解释今天 Fable 争议的源头:模型能力跃迁后,人类的计划、验证和接管机制没有同步。

-> 收听


Tony Fadell 谈品味、产品判断与 AI 时代的手艺 #

Lenny’s Podcast · 约5天前

当编码和原型成本降低,稀缺技能不再是写代码,而是决定什么应该存在、什么该被砍掉、用户如何信任它。Fadell 的观点连接今天的产品讨论:执行便宜后,taste 和判断成为经济过滤器。

-> 收听


🤖 来自 AI 对话 #

当最强模型开始拒绝基准测试,失败的是模型还是测量方式? #

与 Claude Opus 的对话

挑衅性问题:如果 Claude Fable 5 在真实代码任务里表现极强,却在 ProgramBench 上 200 题全拒绝,我们应该相信哪个结果?

多数人的直觉答案是:这是安全策略搞砸了,模型被护栏阉割,分数自然不可信。

但这个答案太简单。真正有意思的是,基准测试正在从“测能力”变成“测制度”。过去的 benchmark 假设模型是一个稳定对象:你给题,它答题,分数代表能力。Fable 5 暴露的新现实是,模型已经不是单一对象,而是模型、策略层、路由层、供应商风险判断和用户身份的组合体。同一个神经网络,在不同场景下会被允许展示不同能力。于是 benchmark 不再只问“它会不会”,还问“系统让不让它会”。

这听起来像作弊,但也像现实世界。飞机发动机的最大推力不是商业航班的日常推力;药物的活性成分不是病人实际能获得的治疗效果。我们真正需要的不是一个裸模型分数,而是三层分数:裸能力、可用能力、可审计能力。ProgramBench 的尴尬恰好说明第三层缺失。

新的思考方式是:未来评测应当把拒绝、降级、解释、申诉路径都纳入分数。一个模型的价值不是“最高能飞多高”,而是当它不飞时,能否告诉你原因、边界和替代方案。能力时代的 benchmark 结束了,治理时代的 benchmark 刚开始。


为什么“写好 prompt”可能已经是上一代技能? #

与 Claude Opus 的对话

挑衅性问题:如果最重要的不是 prompt,而是 loop,那么会写提示词的人会不会像会调制解调器的人一样迅速过时?

显而易见的答案是:不会,prompt 仍然是人与模型沟通的入口,当然重要。

这个答案没错,但它低估了层级迁移。Latent Space 的 Loopcraft 把今天的变化说得很清楚:人不该一次次坐在模型旁边催它下一步,而应该设计能让模型自己触发、检查、回滚、再尝试的循环。Prompt 是一句话,loop 是一个制度。前者像对员工下指令,后者像设计一个小公司。

历史上类似的迁移发生过很多次。早期网页开发者珍惜每一行 HTML;后来真正的杠杆变成模板、框架、部署流水线。早期量化交易员写单个策略;后来核心竞争力变成回测、风控、执行、监控组成的闭环。AI 也是同样:单次回答的质量会被模型升级吃掉,但循环的设计会沉淀为组织能力。

更反直觉的是,loop 不是为了让人更懒,而是为了让人更具体。你必须定义失败是什么,证据是什么,什么时候停止,什么时候升级到人。不会设计 loop 的人,会被模型的热情淹没;会设计 loop 的人,会把模型的热情变成可控产能。

新的思考方式:prompt 是对智能的请求,loop 是对智能的预算、边界和验收。未来简历上最值钱的可能不是“精通提示词工程”,而是“能把混乱任务改造成可运行、可观测、可中止的智能回路”。


开源 AI 必须赢,这句话到底是在说技术,还是在说权力? #

与 Claude Opus 的对话

挑衅性问题:当 Hacker News 上“Open Source AI Must Win”冲上榜单,它真正害怕的是闭源模型更聪明,还是闭源模型有权决定谁能变聪明?

多数人会回答:当然是技术路线之争,开源让创新更快,闭源让安全更可控。

但今天的 Fable/Mythos 争议让这个框架变窄了。闭源模型的核心问题不只是权重不可下载,而是能力可以被按身份、地区、任务类型动态分配。一个研究者可能不是因为不会做某件事而失败,而是因为供应商或监管层不让模型在这件事上帮他。开源在这里变成一种程序正义:至少你知道你拿到的东西是什么,能复现实验,也能把失败归因到代码、数据或硬件,而不是一层看不见的政策。

当然,开源也不是童话。越强的模型越可能被滥用,本地运行也会削弱审计能力。但“安全所以闭源”如果走到极端,会把研究能力集中到少数有算力、有许可证、有政治关系的机构手里。科学史上,望远镜、PCR、Linux 的价值都不只是工具本身,而是让更多边缘位置的人能提出问题。

新的思考方式:开源 AI 的目标不必是让每个人拥有最危险的能力,而是让社会保留可验证的替代路径。没有替代路径的安全,很容易滑向许可制知识。真正健康的生态,需要强模型的审计通道、开放权重的安全分级,以及能在两者之间迁移的公共基准。


AI 成本下降后,为什么产品判断反而更贵? #

与 Claude Opus 的对话

挑衅性问题:如果 Mike Krieger 说 Fable 5 让构建成本坍塌,那创业是不是终于变简单了?

显而易见的答案是:是的。代码、设计、测试、文案都能交给 AI,个人和小团队会获得前所未有的杠杆。

但这只解释了供给侧,没有解释需求侧。当每个人都能在周末做出一个像样产品,市场上最稀缺的东西就不是“能不能做出来”,而是“有没有人应该在意”。Tony Fadell 反复强调 taste,不是怀旧地崇拜工匠精神,而是在说一个经济事实:生产成本越低,注意力成本越高。

这和出版业很像。印刷术降低了复制成本,互联网降低了分发成本,生成式 AI 又降低了创作成本。每一次成本下降都会先带来繁荣,然后带来噪音。最后胜出的不是最会生产的人,而是最会选择、删减、命名、定价、建立信任的人。AI 把“做”的门槛降下来,同时把“为什么做这个而不是那个”的门槛抬上去。

新的思考方式:未来的产品经理、创始人、设计师不再主要靠产出物证明价值,而靠约束证明价值。谁能更早说不,谁能更准确识别用户愿意改变行为的地方,谁能设计验证回路,谁就能把无限生成变成有限产品。AI 让执行便宜,判断因而变贵。


中国 AI 短剧融资热,和美国 Fable 争议其实在讲同一件事吗? #

与 Claude Opus 的对话

挑衅性问题:中国 AI 短剧平台拿到近亿元融资,和美国围绕 Fable/Mythos 的访问控制争议,表面无关,底层是否是同一场产业重组?

多数人会说:一个是内容生产效率,一个是前沿模型安全,当然不是一回事。

但它们共享一个更深的变量:谁拥有把智能转化为流程的权利。AI 短剧不是简单用模型生成视频,而是把剧本、分镜、角色、配音、剪辑、分发变成工业流水线。Fable/Mythos 争议也不只是模型能不能开放,而是谁能把最强智能接入科研、代码迁移、漏洞发现这样的高价值流程。一个发生在内容工业,一个发生在知识工业。差别只是监管敏感度不同。

历史上,每次通用技术成熟,都会先在流程密集行业爆发:电力不是先改变灯泡,而是改变工厂布局;互联网不是先改变网页,而是改变供应链和广告竞价。今天的 AI 也一样,真正的商业化不是“生成一个东西”,而是“重排一整条生产线”。

新的思考方式:不要把中美 AI 差异理解成模型排行榜。美国的焦虑在于前沿能力的权限和安全,中国的热度在于应用流程的规模化吸收。两者会在同一个问题上相遇:当智能成为流水线的一部分,治理对象不再是模型,而是模型嵌入的产业流程。


📚 来自书架 #

选择权:为什么多模型路由比追逐单一最强模型更反脆弱 #

Nassim Nicholas Taleb · 2012

反脆弱系统的关键不是预测未来,而是保留在波动中获益的选择权:让小错误暴露得早、成本低,同时保留向上收益。

与今天的连接: Cline 关于 Fable 5 成本的推文和 Cursor 默认 auto-review 的发布,指向同一个实践:不要把全部希望押在单一昂贵模型上。更稳的做法是让便宜模型生成、强模型抽检、专门 review agent 阻断危险操作,再根据任务难度升级。这样一套工作流比“所有任务都用最强模型”更反脆弱,因为它能从失败样本中调整路由,而不是被一个供应商、一个价格、一个策略层卡死。


系统 1、系统 2 与 AI 自动审查层 #

Daniel Kahneman · 2011

《思考,快与慢》区分系统 1 快速直觉与系统 2 缓慢审慎。人类常把流畅感误认为真实性,而长程 AI 动作越连续,这种误判风险越高。

与今天的连接: Cursor 把 auto-review 设为新用户默认项,本质是在产品层承认:用户不会每次都启动自己的系统 2。Fable 5 越能连续行动,用户越容易被“它看起来很会做事”的流畅感催眠。自动审查层就像产品里的外置系统 2,不负责创造,而负责在关键时刻制造停顿、要求证据、把模糊边界推回到人类面前。


从竞争到垄断:为什么 Fable 5 的争议不是价格战 #

Peter Thiel · 2014

《零到一》的核心判断是:真正的公司通过创造独特价值逃离同质化竞争,而不是在完全竞争里把利润压到零。

与今天的连接: Hacker News 上“Open Source AI Must Win”和 Fable/Mythos 访问限制同时升温,表面是开放与安全的冲突,实质也是控制稀缺能力的商业结构问题。如果最强模型只能由少数公司按规则分发,能力本身就成为垄断资产;如果开源路线能提供可验证替代品,应用层公司才不必在一个许可市场里讨生活。Thiel 的框架提醒我们:AI 公司争夺的不只是模型分数,而是定义市场维度的权力。


组合进化:为什么 MiniMax Sparse Attention 和 agent loops 属于同一类创新 #

W. Brian Arthur · 2009

《技术的本质》认为新技术很少凭空出现,它们是已有技术模块的新组合;一旦组合稳定,又会成为下一层组合的组件。

与今天的连接: MiniMax Sparse Attention 把长上下文的瓶颈拆成索引分支、稀疏块选择和硬件友好的执行路径;Latent Space 的 Loopcraft 则把 agent 工作拆成目标、执行、审查、回滚、再尝试的循环。一个在模型内部,一个在工作流外部,但都体现了 Arthur 所说的组合进化:真正的突破来自重新排列部件之间的关系,而不是单点更大更快。


⚡ 快讯 #

美国政府指令暂停 Fable 5 与 Mythos 5 访问 #

Hacker News · 1100 points / 682 comments

Anthropic 公告称根据美国政令暂停 Fable 5 和 Mythos 5 访问。逾千点赞与六百多条评论说明这已不仅是技术发布,而是能力被地理与政治规则中介化的标志性事件。

-> 原文


Open Source AI Must Win #

Hacker News · 160 points / 35 comments

同日上午冲上 HN 首页的讨论主张开源 AI 是对集中式模型访问的制衡。它与 Fable/Mythos 访问限制同时升温,使争论不再是抽象意识形态,而是谁能检查、复现和使用前沿能力。

-> 原文


AI agent 扫描 DN42 时让运营者破产 #

Hacker News · 1396 points / 506 comments

一个 agent 在尝试扫描 DN42 时烧光运营者资源。这是 loopcraft 时代的具体警示:没有配额、熔断器和审查的自主行动,能把小技术任务变成经济故障。

-> 原文


MiniMax Sparse Attention 把百万 token 上下文成本打下来 #

Hugging Face Papers · 83 upvotes

MiniMax 提出块稀疏注意力,声称在 1M 上下文时注意力计算降低 28.4 倍,prefill/解码在 H800 上大幅加速。长程 agent 的持续自治需要更便宜的注意力,这是硬件友好型架构对应用层的重要支撑。

-> 原文


EvoArena:动态环境中追踪记忆演化 #

Hugging Face Papers · 105 upvotes / 3 comments

MIT 论文把 agent 记忆视为动态演化而非静态追加日志,提出在变化环境中追踪状态更新、遗忘与复用的方法。对构建能长期运行的 agent 有直接意义。

-> 原文


ponytail:让 agent 像懒惰的资深开发者一样思考 #

GitHub · 963 stars

这个 JS 仓库主张让 agent 避免写不必要的代码,把决策推向更简单的工程选择。它和今天的 loopcraft 主题一致:agent 行为应被设计成可复用技能,而非一次性 prompt。

-> 原文


AniShort 获近亿元融资,AI 短剧进入流程化阶段 #

量子位 · 中文科技报道

八点八数字旗下 AI 短剧协作平台 AniShort 完成近亿元融资。国内 AIGC 视频工具正从生成能力竞争进入生产流程、平台化与融资扩张阶段。

-> 原文


The Moral of Fable #

Every — Chain of Thought · 订阅通讯

Dan Shipper 的 6 月 12 日文章把 Fable 5 视为知识工作委托、验证与保留 agency 的转折。它与 Mike Krieger 播客互补:与其把 Fable 当 benchmark 事件,不如把它看作专业人士工作方式的迁移。

-> 原文


快速提及 #

来源内容要点
Product HuntQursor:指向任意 UI 把精确上下文传给 AI · 262 votes连接屏幕理解、computer-use agent 与用户监督的上下文捕获。
GitHubapple/coreai-models · 836 starsApple 端侧 AI 的模型导出与 Swift runtime 工具,平台竞争从云 API 转向本地运行时。
36氪2026年人工智能+的共识与分歧中文侧更关注 AI 如何进入产业与新质生产力叙事。
财联社中央网信办举报中心开设“涉AI应用乱象举报专区”中国侧 AI 治理当日背景,与美国出口控制形成对照。

编辑分析 #

今天最重要的张力是:Fable 5 级别的能力已经摆上桌面,但决定谁能使用、在哪种任务上使用、以什么代价使用的制度,正在成为比模型本身更关键的变量。

Twitter 上 @scaling01 的 ProgramBench 全拒绝、Hacker News 上的美国政府暂停访问、开源 AI Must Win 的反弹,加上 AI 对话里对 benchmark 从“测能力”转向“测制度”的判断,共同说明同一个问题:模型不再是单一对象,而是模型、策略层、路由层、供应商风险判断与用户身份的组合体。Anthropic 的护栏、华盛顿的出口控制、开源社区的反应,都是这个组合体的不同截面。

第一条趋势:AI Engineering 正在从“调用最强模型”转向“设计可审计的模型回路”。 证据来自 Cursor 默认 auto-review、Cline 的便宜模型加审查循环、Latent Space 的 Loopcraft,以及 Recursive 的自动化研究。强模型会被政策与价格切分成不同可用等级,能设计路由、审查、降级和日志的团队,才能把能力变成稳定产出。

第二条趋势:产品判断正在取代代码能力成为稀缺要素。 Tony Fadell 谈 taste、Mike Krieger 描述 Fable 5 改变规划与验证、AI 对话指出执行成本坍塌后“为什么做这个而不是那个”更贵,三者同向。未来创始人和产品经理的价值不来自产出更多,而来自更早说不、定义失败和建立信任。

第三条趋势:AI 治理正从“模型安全”转向“能力分配”。 Fable/Mythos 访问暂停、网信办举报专区、Open Source AI Must Win 的反弹,共同显示治理对象不再是单个模型会不会作恶,而是谁能合法使用前沿能力进行研究、竞争和创新。

延伸阅读建议看三条线索:apple/coreai-models 理解端侧 AI 运行时如何改变平台竞争;36氪人工智能+共识与分歧 观察中文侧产业落地叙事;财联社 AI 应用乱象举报专区 追踪中国 AI 治理的当日动作。


lz.wiki 每日精选 · 32 条来自 28 个源 · 2026年6月13日 13:00 CST RSS 订阅 · 所有精选