1. 每日精选/

每日精选 — 2026年8月13日

今日概览 #

今天最值得看的不是又多了几个模型,而是模型开始以不同的失败方式进入真实工作:Grok 4.6 争夺低价与速度,DeepSeek V4 Pro 把 Agent API 价格压低,Qwen3.8 则把旗舰级权重直接开放。我们也会看到,真正决定结果的已经从“谁的榜单分更高”转向谁能把上下文、权限、评审和责任链接起来。


🐦 来自时间线 (X/Twitter) #

Codex 活跃用户越过 1500 万,/fast 额度兑现重置 #

@thsottiaux · 4小时前 · 6,933 赞

OpenAI Codex 负责人确认,活跃用户已经越过 1500 万,并兑现此前“每增加 100 万活跃用户就重置一次 /fast 额度”的承诺。值得注意的是,这条消息并不是新用户数刚刚发生,而是一次对增长承诺的补账:当 AI 编程工具进入千万级使用规模,额度、速度和服务稳定性本身就变成产品信任的一部分。对开发者来说,模型能力之外,真正影响迁移成本的往往是高峰期能否继续工作,以及厂商是否会把增长红利返还给用户。

-> 原文


Grok 4.6 用八折以上降价挑战闭源模型的“保险费” #

@GavinSBaker · 13小时前 · 6,085 赞

Gavin Baker 认为,Grok 4.6 的表现接近 Fable 5 Max,但输入便宜 80%、输出便宜 88%,形成明显的性价比优势。这个判断仍然来自个人体验和比较,不能当成统一评测结论;但它揭示了竞争的新方向:当前沿模型分数挤在相近区间,价格、响应速度、额度和长任务回合数会比“第一名”更直接地影响模型路由。闭源厂商卖的也不再只是智力,而是少返工、少等待和更稳定的交付预期。

-> 原文


DeepSeek V4 Pro 把 Agent 基准和百万上下文带到低价位 #

@ChrisGPT · 13小时前 · 1,851 赞

DeepSeek V4 Pro 0813 发布后,官方数据称 Terminal-Bench 2.1 从 72.1% 升到 87.9%,CyberGym 从 52.7% 升到 83.3%,DeepSWE 从 12.8% 升到 62.7%,并提供 100 万 token 上下文,输入和输出价格分别为每百万 0.435 美元与 0.87 美元。帖子也提醒我们不要盲信每家厂商挑选的单项基准:当模型都开始用不同榜单讲故事,真实任务的耗时、返工和错误类型才是更可比的指标。

-> 原文


SL2T 让 Pixel 端侧识别手语,服务端完成翻译 #

@GoogleDeepMind · 15小时前 · 1,147 赞

Google DeepMind 发布 SL2T,用于在 Pixel 11 的 Gboard 和 Live Transcribe 中把美国手语直接转成英文。模型同时处理手、身体和面部动作,并将姿态追踪放在设备端,再把需要翻译的表示交给服务器,兼顾了响应场景与隐私边界。它的意义不只在无障碍功能,而在于说明端云分工正在变得具体:敏感的原始动作可以留在本地,复杂的语言转换仍交给云端,模型产品因此要同时处理可用性、社区参与和数据治理。

-> 原文


Paul Graham:创业最难的测试是自己的心理 #

@paulg · 5小时前 · 662 赞

Paul Graham 分享了一次 Office Hours:一位从 2011 年坚持到现在、公司仍经营良好的创始人,给新一批创始人的建议只有一句——最大的考验是自己的心理,能否在障碍不断出现时继续走下去。它不是鸡汤式的“坚持就会成功”,而是对创业时间尺度的提醒:模型和工具会快速换代,产品判断却常常要在没有即时反馈的阶段持续数年。今天的 AI 创业者需要的不只是更快上线,也要能承受每周都被新模型重新定价的心理波动。

-> 原文


卡兹克的模型路由:Grok 做日常,Codex 扛硬活,DeepSeek 跑异步 #

@Khazix0918 · 6小时前 · 251 赞

卡兹克更新了自己的模型组合:Grok Build 与 Grok 4.6 负责日常 Vibe Coding,ChatGPT 与 Codex 处理不能出错的大任务、办公和电脑操控,DeepSeek V4 Pro 则承接不需要实时反馈的自动化和异步 Agent。即使其中包含个人体验和明显的主观判断,这种分工仍比“全场景只用最强模型”更接近真实使用:模型选择正在变成按时延、成本、风险和人工复核能力分层的路由问题。模型商品化的下一步,是让工作流知道什么时候该换模型。

-> 原文


VS Code Agent Plugins 1.0:技能、MCP 与扩展打包成一个安装单元 #

@code · 8小时前 · 208 赞

VS Code 宣布支持 Agent Plugins 1.0,可以把 skills、MCP server 和 AI 扩展打包成一个可安装插件。这个变化看似只是开发者体验优化,实际是在给 Agent 生态补“发行版”层:技能负责流程,MCP 负责工具连接,扩展负责宿主环境,过去分散的配置开始有机会变成可复用、可版本化的团队资产。对独立开发者来说,真正值得关注的是安装之后能否保留权限边界、测试结果和升级回滚,而不只是少写几行配置。

-> 原文


Anthropic 或以约 60 亿美元收购 AI 基建公司 Decart #

@nmasc_ · 3小时前 · 69 赞

这条来自 Bloomberg 的报道声称,Anthropic 正就以约 60 亿美元收购 AI 基建创业公司 Decart 进行谈判。当前只是洽谈消息,不能视为已完成交易;但它提供了一个重要信号:当模型能力越来越接近、调用价格持续下降,实验室的差异化会更多落在推理效率、基础设施和长期运行成本上。大额收购也意味着,所谓“模型公司”与算力、部署和系统优化公司的边界正在变薄,资本开始为每一次推理的边际成本定价。

-> 原文


🎙️ 来自播客 #

Rahm Emanuel:AI 竞争背后的国家能力与中国议题 #

All-In Podcast · Rahm Emanuel · 3小时前

All-In 邀请前奥巴马白宫幕僚长、芝加哥市长和美国驻日大使 Rahm Emanuel,讨论特朗普外交政策、中国与台湾、欧洲衰退、移民、教育、债务和民主党内部政治。Emanuel 的价值不在于提供一个模型发布解读,而在于把 AI 竞争放回国家能力:算力、人才和产业联盟最终要由政府、教育体系与外交策略共同承接。把这期和今天的模型价格战放在一起,我们会发现真正的竞争并不是谁先发一个更高分的模型,而是谁能把技术、资本和制度变成长期执行力。

-> 收听


没有方向盘的出行,商业化难点在车队而非单车 #

科技乱炖 · 卓睿、张宁 · 14小时前

NVIDIA 中国区软件解决方案高级总监卓睿与小马智行 L4 研发负责人张宁,把 L2、L3、L4 的责任边界、计算平台、软件安全和商业模式拆开讨论。最重要的提醒是:车能自己开只是第一步,调度、充电、清洁、维修、事故、乘客体验,以及车辆从投入到退役的全周期成本,才决定 Robotaxi 是否真正成立。NVIDIA 卖的也不只是芯片,而是车端计算、训练、仿真和功能安全组成的底座。它与今天 Agent 的讨论高度同构:演示完成任务不难,难的是把异常、责任和运营账本接住。

-> 收听


大食代留在了它的时代:被吃掉的是中间层 #

商业就是这样 · 肖文杰、约小亚 · 6小时前

这期 29 分钟的商业解剖从大食代 2026 年关闭北京最后一家店讲起。美食广场的形态还在,真正失去价值的是“二房东”位置:统一收银、按营业额向档口抽成的模式,曾经适配餐饮能力不足的购物中心;后来商场自己餐饮化,做大的档口又出去开独立店,上下游同时把中间层挤掉。这个案例对 AI 很有启发:一个曾经必要的协调层,一旦买方学会自营、工具又足够好,原有利润不会因为模式仍然存在而自动保留。

-> 收听


艾语智能:赚钱的 AI 产品,先拒绝显然的效率 #

AI 炼金术 · 张天乐 · 2天前

艾语智能创始人张天乐讲了一个反直觉案例:公司没有用 AI 去把电话催收做得更快,而是批量推进小额信贷诉讼,让员工依据法院、法条和历史成功率执行任务。组织上,他们把代码权限下放到一线,研发从 20 人缩到个位数,并保持一天上线数百次的节奏。这里最值得学习的不是“砍测试岗”这种激进做法,而是先重新定义问题:如果旧流程本身不产生价值,给它加模型只会更快地优化错误目标。AI 原生组织的核心不是人更少,而是任务、权限和反馈距离更短。

-> 收听


🤖 来自 AI 对话 #

同一天掉下三个前沿模型,买家到底在买智商,还是在买一种失败方式? #

与 Claude Opus 的对话

三个模型同日发布,最容易得到的答案是“竞争万岁,谁分高用谁”。但当 Grok 4.6、DeepSeek V4 Pro 和 Qwen3.8 的基准分挤在相近区间,这个答案就不够用了。我们真正要买的不是抽象的智商,而是一次失败会以什么方式发生:便宜模型可能几分钟跑完却留下 bug,贵模型可能多花钱但少一次返工,开源模型则把错误转移到自己的推理栈、显存和运维团队。模型选型因此不应只问谁最聪明,而要问一次错误的全成本是多少。对修 bug 的工程师来说,几美元的价差可能远低于返工一小时的成本;对隐私敏感的团队来说,本地部署又可能比 API 便宜更重要。所谓模型商品化,不是所有模型变得一样,而是我们开始按失败账本而不是榜单排名做采购。


AI 干掉的不是初级工程师,是软件业里那个“把票变成代码”的中产? #

与 Claude Opus 的对话

直觉认为 AI 会先替代初级工程师,资深工程师更值钱,中级岗位只是被挤压。但今天 HN 热议的“AI 正在移除软件工程中产阶级”指出了更锋利的变化:模型拿走的不是写代码本身,而是“把一张清楚的需求票变成可运行代码”这条职业阶梯。以前代码量有天然速度上限,坏决策会被实现成本拖慢;现在一个周末就能生成大量 PR,技术债务以生成速度计息。资深工程师的价值因此不只是会写更好的代码,而是能判断哪些需求不该做、哪些抽象会把错误放大、哪些 PR 必须拒绝。初级岗位仍可能通过探索和脏活保留入口,中间那层熟练实现者却被压缩。问题不是公司还需不需要工程师,而是“实现”不再是足以单独定价的能力。


与 Claude Opus 的对话

表面答案是又一次 API 加密没做好,修补传输方式就够了。更深一层的问题是:如果强模型的推理痕迹可以被客户端持有,再交给同厂的弱模型重放,那么“思考”已经不是模型内部能力,而是可搬运的中间件。弱模型并不需要拥有同等权重,只要没有套上旗舰模型的防蒸馏限制,就可能把隐藏推理块还原成普通文本。于是最有价值的资产不一定是权重,而是一轮认真思考过的中间表示。我们过去把 CoT 当作不能公开的秘密,同时又把它在调用链中来回传递;这是一种产品设计上的矛盾。推理一旦离开模型内部,就必须像 API key、会话令牌一样被最小化、隔离和轮换。否则所谓“加密思维”只是把可转发的 Cookie 换了一个名字。


阿里把 2.4 万亿参数开源的那天,开源还是理想,还是安卓式的铺货? #

与 Claude Opus 的对话

Qwen3.8-2.4T-A95B 开放权重,很容易被解读成开源赢了、闭源要结束。但真正可运行的是约 950 亿激活参数,关键价值也许不是把“灵魂”摊开给世界检查,而是让开发者下周就能在自己的集群上跑同一档能力。它更像安卓式铺货:权重是分发和获客,云服务、推理优化、长上下文 API 与默认工具链才是后续货架。闭源模型仍然可以把少返工、少尴尬和更稳定的长程任务表现卖成保险费。于是两个市场会长期并存:开源出售的是部署自由和分发权,闭源出售的是省心与责任转移。以后看开源发布,我们不该先数参数,而要看它给谁铺了管道、谁会因此获得默认入口,以及模型之外的运行成本最终由谁承担。


菲尔兹奖得主问大模型擅长哪种数学,答案会不会也是对创意工作的判决书? #

与 Claude Opus 的对话

模型在数学上越来越强,并不意味着它已经拥有和数学家相同的创造力。Timothy Gowers 讨论大模型擅长哪类数学时,指出模型更适合在较浅、分叉很多的搜索树上撒网:它读过大量相近论证,也承担得起大量失败尝试;人类专家的优势则常常是“鼻子”,能在一棵又深又乱的树上迅速剪掉看似有希望、实际没有前进的枝。这个差别也会传到创意工作。类型化文章、标准咨询框架和中位水平的视觉稿,本来就有短描述和现成零件,模型会优先吃掉它们;真正难替代的不是“更复杂”,而是事后看似自然、事前没有模板的方向判断。我们不该泛泛地问 AI 会不会取代创作,而要问自己的工作能否只靠知识面加试错撞出来。能,就会被打折;不能,剩下的那一点剪枝能力才是价值。


📚 来自书架 #

Via Negativa:先问该拿掉什么,再问该加上什么 #

Nassim Nicholas Taleb · 2012

《反脆弱》的 Via Negativa 提醒我们,许多系统变强不是靠再叠一层控制,而是先拿掉正在制造脆弱的干预。小冲击如果一直被人为抹平,系统可能在下一次大冲击中整体崩溃。

与今天的连接: 科技乱炖的 Robotaxi 讨论说明,车能开只是第一步,调度、充电、维修和事故责任才是系统账本;当方向盘被拿掉,原本由司机现场消化的小错误会变成车队级负债。它也对应今天的 AI 选型:与其不断增加模型、插件和自动化层,不如先拿掉一个没有价值的旧流程,再决定是否需要 Agent。


五分钟信任翻转:系统1 如何把“稳”偷换成“安全” #

Daniel Kahneman · 2011

《思考,快与慢》里的系统 1 会用眼前的顺滑体验替代完整评估,WYSIATI 则让我们把“所见”误当成“全部”。一次平稳变道、一段通过基准的演示,足以让人暂时忘掉尾部风险、责任边界和样本之外的情况。

与今天的连接: Robotaxi 节目提到,乘客可能只需要五分钟,就从“它行不行”变成“好像比我开得稳”;今天的 Grok、DeepSeek 与 Qwen 竞争也在复刻同一机制,漂亮的榜单分会被偷换成“生产环境安全”。我们需要把失败样本、返工时间和权限边界放回评估表,而不是让一次流畅 demo 替我们做决定。


大食代为什么死在“模式还在”的年份 #

Clayton Christensen · 1997

《创新者的窘境》说明,在位者往往不是因为笨而失败,而是过度服务当前客户,把利润锁在曾经最有价值的一层;当买方学会自营、替代方案足够好,中间层就会同时受到上下游挤压。

与今天的连接: 《商业就是这样》讲大食代关闭北京最后一家店,保留下来的是美食广场形态,消失的是统一收银、按营业额抽成的二房东位置。今天 Qwen 开放权重、DeepSeek 压低 API、Grok 争夺闭源性价比,也在重写 AI 价值链:模型、云和工具链都可能把曾经必要的代理层变成可选项。


加人让项目更慢,减人为什么突然能加快 #

Frederick Brooks · 1975

Brooks 定律指出,给延期的软件项目增加人手,往往会让它更慢,因为沟通路径、培训成本和新接口会吞掉新增产能。软件开发不是可互换的人月,协调本身就是工作。

与今天的连接: 艾语智能的案例把这个规律做了反向实验:减少层级,让一线员工直接拥有受控的代码权限,并用模型缩短任务到反馈的距离。VS Code 把 skills、MCP 和扩展打包,也是在减少配置接口。Agent 不会消灭沟通成本,只会把它从会议室搬进上下文窗口;如果每个 Agent 都要和每个人同步,所谓 AI 原生组织仍然会被拓扑结构拖慢。


⚡ 快讯 #

Unsloth 把 Qwen3.8、DeepSeek-V4 带进本地训练与运行界面 #

GitHub Trending · 70,677 stars

Unsloth 提供本地运行和训练大模型的桌面界面,已经覆盖今天的 Qwen3.8、DeepSeek-V4、Kimi K3 等模型。它的意义在于把“开放权重”从下载链接变成可操作的本地路径:真正的门槛会从拿到权重,转移到量化、显存、微调和部署工具。

-> 原文


DeepSeek V4 Pro 0813 已进入 OpenRouter 与 API 调用链 #

Hacker News · 776 points / 294 comments

DeepSeek V4 Pro 0813 已出现在 OpenRouter,支持 thinking 与 reasoning_effort;它与 Grok 4.6、Qwen3.8 权重在同一夜进入开发者视野,模型竞争开始直接争夺真实调用入口。

-> 原文


Qwen3.8-2.4T:旗舰级 MoE 权重开放 #

Hacker News · 519 points / 114 comments

阿里首次开放 Max 级 Qwen3.8 权重,总参数 2.4T、激活约 95B,原生上下文 262k,并可扩展到约 1M。开放权重的影响不只在参数规模,而在它能否进入 vLLM 和本地套件。

-> 原文


AI 正在压缩“把工单变成代码”的软件工程中层 #

Hacker News · 748 points / 681 comments

Florian Herrengt 的文章认为,Coding Agent 先挤压的是实现清晰需求的中层工作,而不是简单的初级岗位。讨论重点从“谁会被替代”转向谁负责规格、评审和技术债务。

-> 原文


ToolHazard:把 Agent 安全评测从固定沙盒扩展到对抗环境 #

Hugging Face Daily Papers · 2026年8月13日

ToolHazard 关注工具型 Agent 在环境状态中遭遇间接提示注入的问题,并扩大可测试的对抗环境与注入位置。对要上线 Agent 的团队来说,工具权限和真实环境评测比又刷一遍 SWE-bench 更接近事故风险。

-> 原文


来源内容要点
Hugging FaceAI4AI at Test-Time · 21 赞强模型编写推理时 harness,可以在不改权重的情况下把弱模型平均得分从 0.49 推到 0.91;工程化脚手架本身正在成为蒸馏替代品。
Product HuntDograh · 471 赞 / 113 评论开源 VAPI 替代方案把语音 Agent 基础设施做成可自托管产品,说明语音层也在从演示走向运行时。
OpenAI BlogFrom assistance to execution · 官方文章OpenAI 将企业使用路径从 Copilot 推向 Agent 执行,核心竞争转向流程、权限和可交付结果。
LobstersIntroducing chestnut · 工程社区上榜comma.ai 的 chestnut 展示端侧与驾驶栈如何把模型能力嵌进具体设备,而不是停在 API 层。
V2EXDeepSeek V4 Pro 正式版讨论 · 61 回复中文开发者讨论从单一跑分转向中国模型生态、公司竞争和长期追赶路径。

编辑分析 #

今天真正的分水岭,不是哪个模型赢了榜单,而是谁能把“模型犯错之后怎么办”变成一条可计算、可回滚的工作流。

Grok 4.6 的低价、DeepSeek V4 Pro 的 Agent 基准和 Qwen3.8 的开放权重,把智力本身推向商品化;卡兹克的模型路由则说明,真实用户已经按风险、速度和异步程度给模型分工。Robotaxi 节目与《反脆弱》提供了同一个提醒:单车能开、Agent 能调用工具,都不等于系统能承受长尾事故。大食代的中间层消失,又和软件工程中层被压缩形成镜像——当买方能自营、模型能生成,原本负责把清晰需求变成执行结果的那层价值会最先被重估。

三个趋势值得继续盯住。第一,模型采购正在从智力排名转向失败成本会计:同一任务的耗时、返工、人工复核和隐私代价,将比单项 benchmark 更决定路由;我们应建立自己的任务账本。第二,AI Engineering 正在与 ML Research 分道扬镳:VS Code Agent Plugins、Unsloth、AI4AI harness 和 ToolHazard 说明,技能打包、推理脚手架、评测环境和安全回滚会成为独立的工程资产;会搭系统的人不必训练基础模型,也能拥有高杠杆。第三,开源模型的护城河从权重转移到分发与默认工作流:Qwen 开放权重、DeepSeek 低价 API、Grok 闭源服务并不互相淘汰,而是在争夺谁成为开发者的第一入口。

想继续深挖,可以读 Grok 4.6 官方发布,看闭源模型如何用长任务和价格塑造产品定位;再读 ToolHazard,把 Agent 安全从抽象原则落到环境攻击;最后看 Nathan Lambert 的 AI 教科书反思,理解哪些知识工作会先被“可压缩性”重新定价。


lz.wiki 每日精选 · 31 条来自 24 个源 · 2026年8月13日 13:00 CST RSS 订阅 · 所有精选