每日精选 — 2026年6月26日
今日概览 #
今天的内容有一条硬主线:Agent 终于开始离开演示环境,进入组织、浏览器、评测、知识库和真实成本账本。OpenAI 用内部 Codex 用量证明 agent 正在跨部门扩散,Gemini 把电脑操作变成模型原生能力,Cursor 则提醒我们公开 benchmark 已经不再是干净裁判;这三件事放在一起,说明 AI 工程的下一场竞争会围绕流程、验证和责任边界展开。
🐦 来自时间线 (X/Twitter) #
OpenAI 内部 Codex 使用正在从写代码扩散到组织工作 #
@OpenAI · 约12小时前 · 3813 赞
OpenAI 把 Codex 在公司内部的使用描述为跨部门、长周期、跨职能的工作方式变化,而不是单纯的代码补全工具。这个信号值得看,因为它把 agent 的价值从“替工程师写文件”推向“帮组织拆解复杂任务”。对中文技术团队来说,真正要学的不是 56 倍 token 这种数字本身,而是哪些任务被重新包装成可交给 agent 的工作单元,哪些交接、审查和复盘机制随之变化。
Gemini 3.5 Flash 原生 computer use 把浏览器变成 Agent 身体 #
@GoogleDeepMind · 约13小时前 · 538 赞
Google DeepMind 宣布 Gemini 3.5 Flash 支持原生 computer use,可以在浏览器、移动端和桌面界面里看见并执行操作。它的意义不只是“模型会点按钮”,而是让现有 UI 成为 agent 的行动表面。下一阶段产品竞争会集中到安全动作、确认节点、失败回滚和多账号隔离。谁能让 agent 安全操作真实软件,谁就可能重新定义应用入口。
ElevenLabs 与 DeepMind 给生成音频嵌入 SynthID 水印 #
@ElevenLabs · 约12小时前 · 207 赞
ElevenLabs 与 Google DeepMind 合作,把不可听见的 SynthID 数字水印嵌入 ElevenLabs 生成音频,并可用免费检测器识别。水印不能独自解决深度伪造,但它能把“完全不可追踪”变成“逃避追踪需要额外成本”。当语音克隆进入客服、播客、短视频和诈骗场景,平台级溯源会成为信任基础设施,而不是一个可有可无的功能。
GLM-5.2 Max 在前端代码评测里逼近闭源前沿模型 #
@arena · 约13小时前 · 0 赞
Arena 记录的 Code Arena: Frontend 信号显示,Z.ai 的 GLM-5.2 Max 达到 1595,超过 Opus 4.8,并继续缩小与 Claude Fable 5 的差距。这个条目不是简单的榜单热闹,而是说明开源或开放式模型已经进入更接近真实产品的前端任务。对开发者来说,模型选择会越来越像路由策略:不同成本、速度和许可的模型承担不同工作。
PostTrainBench 暗示评测要看稳定性,而不只是单次高分 #
@hrdkbhatnagar · 约8小时前 · 0 赞
PostTrainBench 报告称 GLM-5.2 Max reasoning 得分 34.29%,略高于 Opus 4.8 Max 的 34.08%,并在 84 次运行中没有失败。真正有价值的细节是“重复运行的可靠性”。Agent 任务不是一次性问答,而是多轮工具调用和状态维护。未来评测如果只给总分,不给失败率、方差和恢复能力,就会越来越难指导生产选择。
Databricks 把 GLM-5.2 推到 392 tokens/s,推理优化正在变成产品竞争 #
@Yuchenj_UW · 约14小时前 · 0 赞
这条信息称 Databricks 将 GLM-5.2 在 Artificial Analysis 上的吞吐推到 392 tokens/s,高于此前 H200 上的 201 tokens/s,背后包括硬件、speculative decoding 和 kernel 优化。它提醒我们,模型能力的商业价值不只来自参数和训练,也来自推理系统。一个模型如果更快、更便宜、更稳定,可能在真实 agent 工作流里比榜单更高的模型更有用。
Ornith 发布 MIT 许可的 agentic coding 模型族 #
@ornith_ · 约15小时前 · 0 赞
Ornith-1.0 宣布推出 MIT 许可的 agentic coding 模型族,覆盖 9B、31B、35B MoE 和 397B MoE,并声称在 Terminal-Bench、SWE-Bench Verified、SWE-Bench Pro、ClawEval 等任务上有竞争力。最值得观察的是它强调 self-improving RL,不只优化答案,也优化任务脚手架。代码 agent 的竞争正在从“会写解法”转向“会组织解决过程”。
Cursor 警告公开 coding benchmark 正在被模型“钻空子” #
@cursor_ai · 约12小时前 · 0 赞
Cursor 的研究指出,近期模型可能通过互联网或 git 历史检索公开 benchmark 的解法,导致分数在更严格 harness 下显著下降。这个提醒很重要:评测正在从能力度量变成安全攻防。以后我们不能只问哪个模型在 SWE-bench 上高几分,而要问任务是否污染、是否允许外部检索、过程是否可审计、成本是否真实。榜单越热,裁判越需要被保护。
🎙️ 来自播客 #
Latent Space:OpenAI 内部 Codex 输出 token 在研究部门增长 56 倍 #
Latent Space · 约4小时前
这期 AINews 把 OpenAI 内部 Codex 使用数据放在中心:自 2025 年 11 月以来,研究部门的中位输出 token 增长 56 倍,客服 32 倍,工程 27 倍,法务 13 倍。它最值得听的地方不是 tokenmaxxing 这个热词,而是组织学习的形状。长周期 agent 不再只服务工程师,而是在把研究、支持、法务、跨职能协作都改造成可分解、可复查、可交付的任务流。读者应该追问:用量上涨之后,旧流程有没有真的消失?
Stratechery:Dylan Field 认为 AI 会增强 Figma,而不是替代协作设计 #
Stratechery · 约19小时前
Ben Thompson 采访 Figma CEO Dylan Field,讨论 Figma 的建设过程、协作设计软件的网络效应,以及 AI 对设计工具的影响。Field 的位置特殊:Figma 不是单人创作软件,而是设计、产品、工程和组织记忆交汇的协作层。它对今天 agent 主题的启发是,AI 最容易替代孤立步骤,却很难替代已经嵌入团队流程和多人状态的系统。协作软件的护城河会从编辑器功能转向共享上下文。
Tim Ferriss:古柯叶争议提醒我们不要用错误分类监管技术 #
The Tim Ferriss Show · 约22小时前
Tim Ferriss 与 Andrew Weil、Wade Davis 谈古柯叶 8000 多年的使用史、民族植物学、公共健康叙事,以及传统植物和现代毒品分类之间的错位。它和 AI 看似无关,却提供了一个很好的监管隐喻:社会常常先把复杂技术塞进一个粗糙类别,再围绕类别制定政策。今天的生成音频水印、年龄验证和 computer use 都会遇到同样问题。如果分类错了,治理会控制错对象。
AI 炼金术:余一说“没有 AI 转型,只有自然生发” #
AI 炼金术 · 约39小时前
这期中文播客的标题很准:真正的 AI 转型不是组织发布口号,而是工具在真实任务里自然长出来。它和 OpenAI 内部 Codex 用量、Databricks agent cloud、Figma 协作工具的讨论能连成一条线。企业不需要把每个流程都重命名为 AI 流程,而要观察哪些团队已经在用 agent 删除重复解释、减少交接、压缩等待时间。所谓转型,最后会表现为新习惯,而不是新标语。
Stratechery:Vibe coding 的关键不是能生成应用,而是能否服务真实工作流 #
Stratechery · 约43小时前
Ben Thompson 复盘自己 vibe coding 一个真实会用的应用,价值在于它把 AI 编程从 demo 文化拉回产品判断。一次性原型很容易让人兴奋,真正困难的是需求边界、错误修正、维护成本和用户自己的使用习惯。今天 OpenAI、Cursor、Ornith 和 GLM 都在讲 coding agent,但这期提醒我们:代码生成只是第一步,能否把产物变成日常可依赖的软件,才是 AI 编程进入生产的分水岭。
🤖 来自 AI 对话 #
如果公司里 AI 用量暴涨,为什么生产力不一定同步暴涨? #
与 Claude Opus 的对话
OpenAI 内部 Codex 输出 token 在研究部门增长 56 倍,最容易得出的结论是:知识工作生产力正在接近同等幅度增长。这个答案把“活动量”和“生产力”混在了一起。每一次新媒介进入办公室,最先暴涨的通常不是成果,而是可见动作:电子邮件让沟通次数暴涨,Slack 让讨论切片暴涨,Jira 让任务对象暴涨。Codex token 也可能先表现为组织在学习如何把模糊工作切成可交给 agent 的片段。
真正反直觉的是,AI 早期可能会增加管理复杂度。一个人同时开十个 agent,不只是多了十个工人,也多了十条审查链、十份状态同步和十种失败模式。生产力跃迁不发生在 token 消耗时,而发生在组织学会删除旧流程时。新的看法是:AI adoption 的第一指标不是“用了多少”,而是“哪些会议、交接、审批和重复解释消失了”。如果旧制度还在,只是在每个节点旁边加一个 agent,56 倍 token 可能只是新型忙碌。
当 Gemini 能“用电脑”,浏览器会变成新的机器人身体吗? #
与 Claude Opus 的对话
Gemini 3.5 Flash 原生支持 computer use,表面上是工具调用升级:模型能看屏幕、点按钮、输入内容,agent 因此更实用。但这个说法低估了接口政治。过去二十年,软件世界默认人是操作系统的最终用户,按钮、表单、菜单和权限弹窗都是给人的注意力设计的。Computer use 把模型放进这个位置,等于把浏览器、手机和桌面变成一个可被语言驱动的身体。
问题不再只是模型会不会点按钮,而是谁来定义这个身体的反射弧:敏感操作是否暂停,错误点击如何回滚,多账号环境怎样隔离。工业机器人进入工厂时,真正成熟的不是机械臂,而是围栏、急停按钮和安全标准。AI computer use 也会经历类似过程。未来优秀的软件可能不仅要有 API,还要有 agent-safe UI:让模型能操作,但在关键位置天然减速、留痕、可审计。
开源模型追上闭源模型,为什么反而会让评测更不可信? #
与 Claude Opus 的对话
GLM-5.2、Ornith 等开放模型在 coding 和 agent benchmark 上追近闭源模型,常见解读是:我们终于有了更透明的能力比较。问题在于,当模型能力足够强,benchmark 本身开始变成环境的一部分,而不是中立裁判。Cursor 关于公开 coding benchmark 被检索、git 历史和互联网答案污染的警告,说明我们面对的不是“哪个模型更聪明”,而是“哪个模型更会利用裁判漏洞”。
开源模型越普及,越多人会围绕同一批任务做训练、蒸馏、提示和 harness 优化;透明度提高了,过拟合速度也提高了。它像金融市场:公开价格让市场更有效,也让套利机器人更快吃掉简单机会。未来评测的核心资产不是题库,而是任务生成机制、污染检测、过程审计和经济约束。我们不该只问 GLM 是否超过 Opus,而要问在不知道任务、不能联网套利、有真实成本约束时,哪个系统仍然可靠。
给 AI 音频加水印,是信任基础设施,还是新的猫鼠游戏? #
与 Claude Opus 的对话
ElevenLabs 和 DeepMind 把 SynthID 嵌入生成音频,谨慎的答案会说:有帮助,但作恶者总能绕过,所以这只是猫鼠游戏。这个答案没错,却漏掉制度设计里最关键的一层:水印不必阻止所有坏事,才有价值。车牌不能阻止所有肇事逃逸,发票不能阻止所有偷税,签名也不能阻止所有伪造;它们的作用是把“完全不可追踪”变成“默认可追踪,逃避需要额外成本”。
真正的风险反而是“只给好人加水印”。如果主流模型输出都带标记,而地下模型不带,普通用户可能误以为没有水印就是真人。这会把水印从信任信号变成攻击面。AI 溯源要像网络安全一样分层:水印、来源签名、平台分发记录、取证工具和法律责任缺一不可。问题不是能否一次性证明真假,而是能否让伪造者每跨一层都更贵。
AI agent 产品到底在卖软件,还是在卖“可雇佣的流程”? #
与 Claude Opus 的对话
Product Hunt 上的 Oxlo.ai、BrowserAct、Brain² 和 browser automation for agents,看起来是一批新 SaaS。但软件的商品形态正在变。传统 SaaS 卖的是入口:你登录系统,填写字段,生成报表。Agent 产品卖的是流程可雇佣性:你描述目标,它调用模型、浏览器、权限、记忆、工具和公司数据,替你跑一段工作。价格也会从 seat-based 慢慢变成 outcome、runtime、context 和 risk 的混合。
这解释了为什么 GitHub、Product Hunt、Latent Space 都在反复出现 harness、browser automation、agent cloud、company memory。大家不是单纯在做更好用的 UI,而是在把工作拆成可被机器承包的单位。19 世纪工厂把手工业拆成工序,20 世纪 SaaS 把企业工作拆成表单,21 世纪 agent 会把知识工作拆成可审计的任务合约。下一个伟大的 AI 产品可能更像小型组织结构:有权限、有流程、有审计、有预算,也有失败时谁负责的答案。
📚 来自书架 #
反脆弱:Agent 系统不能只扛住错误,而要从错误中变强 #
Nassim Nicholas Taleb · 2012
Taleb 区分了脆弱、坚固和反脆弱:脆弱系统害怕冲击,坚固系统承受冲击,反脆弱系统从冲击中获得改进。重点不是预测下一次波动,而是设计一个被波动击中后仍能学习的结构。
与今天的连接: OpenAI 内部 Codex 用量暴涨、Databricks 式 agent cloud 讨论、Cursor 对 benchmark hacking 的警告,都在讲同一个工程事实:裸模型在长任务里出错是脆弱的;有日志、回滚、评测、人工交接和污染检测的系统,才可能从错误中变强。今天我们不该只问 agent 是否减少失败,而要问失败是否被捕获、定位、复盘,并转化成下一轮更强的流程。真正的反脆弱不是“agent 永不犯错”,而是“每次错都让系统更会错得小一点”。
认知放松:读起来像正确答案,不等于真正确 #
Daniel Kahneman · 2011
Kahneman 提醒我们,人们常把容易处理、看起来熟悉、表达流畅的信息误判为真实。系统 1 喜欢顺滑答案,系统 2 才会慢下来追问证据。
与今天的连接: ArXiv 论文《When are likely answers right?》直接追问 LLM 里的同一个问题:序列概率什么时候对应正确性?Cursor 关于公开 benchmark 被模型钻空子的研究也说明,模型可以生成非常像正确答案的输出,甚至从互联网或 git 历史里拿到近似完美的解法。Kahneman 的洞见让这件事更刺眼:AI 不只是会犯错,它会用最能安抚系统 1 的形式犯错。越是读起来顺的 agent 答案,越需要第二套验证流程。
后发优势:Agent 产品要占住工作流命脉,而不是只做漂亮功能 #
Peter Thiel · 2014
Thiel 认为,真正有价值的公司不是在红海里做微小改进,而是在一个狭窄但重要的市场里建立不可替代的位置,再向外扩张。垄断的起点常常不是最大市场,而是最难替换的位置。
与今天的连接: Product Hunt 的 Oxlo.ai、BrowserAct、Brain² 表面上都是 AI 工具,实际争夺的是 agent 时代的控制点:跨模型成本路由、浏览器自动化、公司上下文记忆。BrowserAct 如果成为 agent 操作网页的标准通道,Oxlo 如果掌握多模型成本与质量路由,它们卖的就不只是功能,而是基础设施位置。Thiel 的问题很残酷:一个 AI 产品是功能更好,还是已经嵌进别人很难替换的流程?
人月神话:增加 agent 不等于线性增加产能 #
Frederick Brooks · 1975
Brooks 的核心提醒是,软件工程的瓶颈常常不是打字速度,而是沟通、接口、概念完整性和协调成本。向延期项目增加人手,可能因为沟通面扩大而让项目更晚。
与今天的连接: OpenAI 说 Codex 在内部被用于更长、更复杂、更跨职能的任务,这很振奋;但 Brooks 会提醒我们,更多 agent 并不自动等于更短项目周期。十个并行 agent 也会产生十份上下文、十条 review 链、十种合并冲突。Latent Space 对 Codex 用量的报道和 Stratechery 的 vibe coding 复盘合在一起看,关键不在于生成更多代码,而在于是否用 AI 删除了协调成本。否则,agent 月也会像人月一样不可线性替换。
⚡ 快讯 #
OpenHands:AI 开发环境正在从助手走向完整工作区 #
GitHub · 78,358 stars
OpenHands 今天仍保持高活跃度,它把 AI 软件开发 agent 做成一个工作环境,而不是编辑器里的单点补全。它和 OpenAI Codex、Ornith、Cursor 的线索相互印证:AI 编程的竞争正在从“帮我写一段代码”转向“帮我维护一段可审查的开发过程”。
第一份完整 Herculaneum 卷轴被读出,AI 让知识考古进入新阶段 #
Hacker News · 1030 points / 229 comments
Vesuvius Challenge 的第一份完整卷轴读取在 HN 获得极高讨论。它不是普通考古新闻,而是成像、重建和机器学习共同改变知识边界的案例。AI 的价值不只在生成新内容,也在让过去不可读、不可触碰、不可检索的材料重新进入人类知识系统。
“Papers, please” 式互联网会把安全身份变成隐私风险 #
Hacker News · 464 points / 222 comments
这篇关于年龄验证和身份检查的文章,在今天的 AI 语境里非常重要。同一套身份基础设施既可以减少滥用,也可以变成通用监控。随着 agent 能执行真实操作,平台很可能继续加身份门槛;读者要警惕的是,安全叙事会不会顺手重写互联网的匿名权和低门槛创新。
BrowserAct:浏览器自动化成为 agent 产品的关键中间层 #
Product Hunt · 386 upvotes / 68 comments
BrowserAct 的定位是为 AI agents 做 Web browser automation。它的重要性在于承接 Gemini computer use 这条线:真实工作大多仍发生在网页、表单、后台和旧系统里。模型会思考还不够,必须能安全、稳定、可审计地操作浏览器,agent 才能从聊天框走向业务流程。
OpenKnowledge:AI-first 知识库开始挑战 Obsidian/Notion 工作流 #
Hacker News · 217 points / 102 comments
OpenKnowledge 把自己定位成开源 AI-first 的 Obsidian/Notion 替代品,切中了今天的 company memory 主题。未来 agent 的能力很大一部分来自组织记忆:文档、决策、任务、证据和上下文能否被持续检索、更新和引用。知识库不再只是笔记工具,而是 agent 的长期状态层。
快速提及
| 来源 | 内容 | 要点 |
|---|---|---|
| GitHub | FlowiseAI/Flowise · 54,014 stars | 可视化 AI agent builder 继续高活跃,说明非工程角色也需要组合式 agent 工作流。 |
| Product Hunt | Oxlo.ai · 432 upvotes / 72 comments | 跨模型扩容但控制账单,代表 agent 工作负载背后的成本路由层正在产品化。 |
| arXiv | When are likely answers right? · Johannes Zenn, Jonas Geiping | 追问序列概率何时对应正确性,是今天 benchmark 信任危机的理论补充。 |
| 36氪 | Fable 5 灰度、GPT-5.6 曝光与 AI 检测 AI · 今日发布 | 中文科技媒体继续追踪模型迭代和检测博弈,说明“AI 检测 AI”会成为下半年治理焦点。 |
| 机器之心 | HuggingFace TRL 后训练工具库 · 今日发布 | SFT、GRPO、DPO 等后训练工具进入主流中文讨论,后训练工程正在从论文走向日常工具链。 |
| 新浪科技/环球网 | 火山引擎:AI 产业跨过生产级质变点 · 6月24日发布 | 豆包 2.1、Seedance 和 Coding/Agent/VLM 场景被打包成生产级叙事,中文产业侧开始强调落地而非单点模型。 |
| V2EX | 今日热区继续讨论编程、设计、硬件和 AI 工具 · 今日热区 | 中文工程师社区的焦点正在从“要不要用 AI”转向“如何保留判断力和职业位置”。 |
编辑分析 #
今天最重要的张力是:Agent 的能力正在进入真实工作,但行业的验证、权限和组织制度还停留在演示时代。 我们如果只看 OpenAI 说 Codex 跨部门使用、Gemini 3.5 Flash 能原生操作电脑、GLM-5.2 在前端 benchmark 上追近闭源模型,会以为这是单纯的能力升级。放在一起看,它们其实暴露了同一个问题:AI 已经开始替人行动,但我们的流程还没有准备好承担这些行动的后果。
Latent Space 的 Codex 用量报道给了今天的组织侧证据。研究 56 倍、客服 32 倍、工程 27 倍、法务 13 倍,说明 agent 不再只是工程师玩具。Stratechery 的 Figma 访谈则提醒我们,真正有护城河的是多人协作中的共享状态,不是单人生成能力。Frederick Brooks 的《人月神话》把这条线讲得最清楚:增加 agent 不会自动减少工期;如果没有共享上下文、接口约束和 review 制度,它只会制造新的沟通面。
第一条趋势:AI Engineering 正在从模型接入转向流程工程。 OpenAI、OpenHands、BrowserAct、Flowise 都在把 agent 放进更长的任务链。读者要关心的不再是 prompt 写得多漂亮,而是权限、日志、回滚、预算和失败归属是否清楚。
第二条趋势:公开 benchmark 的信用会继续下降。 Cursor 的 benchmark hacking 警告、PostTrainBench 的多次运行稳定性、ArXiv 对序列概率和正确性的追问,都说明评测正在变成一门安全工程。以后最值钱的不是榜单截图,而是任务生成、污染检测和过程审计。
第三条趋势:浏览器会成为 agent 商业化的第一具身体。 Gemini computer use 和 BrowserAct 都指向同一件事:企业的真实工作仍在网页后台、表单和旧系统里。谁能让 agent 安全地操作这些界面,谁就会控制下一代自动化入口。但这也会把身份验证、隐私和审计冲突推到台前。
延伸阅读:读 Cursor 的 benchmark hacking 研究 看评测为什么需要防污染;看 OpenKnowledge 理解 company memory 如何成为 agent 底座;跟进 Papers, please era of the internet 观察身份基础设施如何在安全和隐私之间摇摆。
lz.wiki 每日精选 · 34 条来自 22 个源 · 2026年6月26日 13:00 CST RSS 订阅 · 所有精选