每日精选 — 2026年4月12日
今日概览 #
今天的内容呈现出一个清晰的主题: AI 工程正在从"用模型"走向"驯服模型"。Gary Marcus 拆解 Claude Code 发现它远非纯深度学习, Latent Space 揭秘 OpenAI 团队每天烧 10 亿 token 运转零人工代码工厂, 16 个 Claude Agent 并行两周靠的是 Bash 循环和 Git 锁文件。当所有人都在讨论模型智能时, 真正推动生产力的是围绕模型的工程架构, 也就是 harness engineering。与此同时, Google Gemma 4 和 Netflix VOID 的发布表明, 开源模型正在从"追赶通用能力"转向"深耕垂直场景"。
🐦 来自时间线 (X/Twitter) #
Gary Marcus: Claude Code 不是纯深度学习, 这改变了一切 #
@GaryMarcus · 21小时前 · 2002 赞
Gary Marcus 对 Claude Code 源码泄露做了一次深度分析, 核心结论: Claude Code 不是纯 LLM, 不是纯深度学习, 甚至"远远不是"。它的核心是一套精心设计的工程架构, LLM 只是其中一个组件。Marcus 认为这才是 Claude Code 成为"LLM 时代以来最大进步"的真正原因, 也证明了他长期以来的观点: 纯深度学习路线有其天花板, 真正有用的 AI 系统需要混合架构。这个分析对理解 AI 编程工具的本质有重要价值, 不是模型越大越强, 而是工程架构决定上限。
LLM 完全不知道自己是怎么运行的 #
@theo · 37小时前 · 1699 赞
Theo 指出一个容易被忽视的事实: LLM 对自己的运行环境一无所知, 不知道跑在什么 GPU 上, 不知道 temperature 设了多少, 不知道自己是否被量化过。它们只是在做下一个 token 预测, 一如既往。1700 赞说明这个"常识"其实很多人没想清楚。这对 AI 产品设计有直接启示: 当用户问 AI"你确定吗", AI 的"确定"和人类的"确定"是完全不同的东西, 因为它连自己的推理参数都无法感知。
16 个 Claude Agent 并行两周不打架: 靠 Bash 循环和 Git 锁文件 #
@timyangnet · 6小时前 · 2 赞
Tim Yang 分析了 Nicholas Carlini 让 16 个 Claude Agent 并行协作两周的编译器项目。最有意思的发现是: 他完全绕过了复杂的 Agent 编排框架, 回归了最朴素的方案。任务池是一个共享文件夹, 互斥锁是 .lock 文件, 分布式协同靠 Git, 连 merge conflict 都让 Claude 自己解决。每个 Agent 启动后拉取最新状态、认领未锁定任务、完成后 push 并释放锁。所有 Agent 都可以往任务池提交新任务。对长任务场景, 这种设计模式省去了昂贵的编排管理成本, 非常值得借鉴。
fireworks-tech-graph: 专为 Claude Code 打造的技术架构图生成 Skill #
@berryxia · 昨日 · 1797 赞
Berry 推荐了开源项目 fireworks-tech-graph, 一个专为 Claude Code 设计的技术图生成 Skill。针对的痛点很实在: 用 diagrams.net 画 Multi-Agent、RAG、Tool Call 架构图, 永远对不齐、配色丑、导出模糊。这个工具支持一句话出图, 直接集成到 Claude Code 工作流。1797 赞和 328 转发说明开发者社区对"AI 辅助可视化"有强烈需求。技术架构图是开发者沟通的重要媒介, 如果 AI 能把这个环节从"花半天画图"变成"一句话生成", 效率提升是实打实的。
graphify: 把代码库构建成知识图谱, 让 AI 真正看懂项目 #
@GitHub_Daily · 昨日 · 211 赞
GitHub Daily 推荐了 graphify, 一个能自动把整个代码库构建成知识图谱的开源项目。解决的是 AI 辅助编程的核心痛点: 项目一大, 代码之间的依赖关系和架构决策来龙去脉光靠翻文件根本理不清。graphify 可以直接对接 Claude Code、Cursor、Gemini CLI 等主流 AI 编程工具, 让它们在修改代码前先"看懂"整个项目结构。这和 Gary Marcus 对 Claude Code 的分析形成呼应: AI 编程的瓶颈不是模型智能, 而是上下文理解。
Anthropic 发布 Project Glasswing: Claude Mythos 漏洞检测模型 #
@AnthropicAI · 5天前 · 0 赞
Anthropic 推出 Project Glasswing, 一个旨在保护全球关键软件安全的紧急计划, 由最新前沿模型 Claude Mythos Preview 驱动。官方声称该模型在发现软件漏洞方面的能力"超过了除最顶尖人类专家外的所有人"。虽然发布已有 5 天, 但这个项目仍在持续引发争议: 一是"太危险不敢完全发布"的定位本身就是营销; 二是 HN 上有研究显示小模型也能找到 Mythos 找到的漏洞, 挑战了"只有前沿模型才能做安全研究"的叙事。
OpenAI 重构 Pro 订阅: $100/月, 5 倍 Codex 用量, 300 万周活用户 #
@OpenAI · 3天前 · 0 赞
OpenAI 调整了 ChatGPT 订阅体系, 推出新的 $100/月 Pro 层级, 主要卖点是 5 倍于 Plus 的 Codex 使用量。为庆祝上线, 5 月 31 日前 Pro 用户可享受 10 倍 Codex 用量。背景是 Codex 周活用户已达 300 万。这个定价策略很有意思: OpenAI 把 AI 编程从"附带功能"提升为"值得单独付费的核心产品"。$100 的价格锚定也在暗示, AI 编程工具的价值不应该用 $20 来衡量。
Simon Willison 深度拆解 Meta Muse Spark 模型和 meta.ai 代码工具 #
@simonw · 4天前 · 0 赞
Simon Willison 对 Meta 新发布的 Muse Spark 模型做了深度分析, 并特别关注了 meta.ai 聊天界面中的 Code Interpreter 和 container.visual_grounding 工具。Willison 一贯的风格: 不看宣传看实现, 通过实际使用发现了不少有趣的技术细节。对于关注多模态和代码执行能力的开发者, 这篇分析值得一读。
🎙️ 来自播客 #
All-In E267: Anthropic Mythos 争议、AGI 模型与风投趋势 #
All-In Podcast · 昨日发布
四位主持人用大量时间讨论了 Anthropic Mythos 模型引发的争议: 一方面是安全能力的真实突破, 另一方面是"太危险不发布"这个叙事本身就是营销手段。话题延伸到 AGI 模型竞赛格局、AI 安全的行业-政府协调机制、以及 OpenClaw 的战略定位。后半段转向 Polymarket IPO 可能性和风投趋势变化。作为 AI 行业的风向标播客, 这期最有价值的是四位不同背景的投资人对 Mythos 的分歧: Sacks 认为安全叙事被过度工具化, Friedberg 认为能力本身不可忽视。
“如果你的安全声明本身就是你最好的营销, 那我们怎么区分真正的风险警告和产品发布?” — David Sacks
Harness Engineering: OpenAI 百万行代码零人工编写零人工审查 #
Latent Space · 5天前发布
这可能是本月最重要的一期技术播客。Ryan Lopopolo 来自 OpenAI Frontier 团队, 揭秘了他们如何运营一个超过 100 万行代码的代码库, 其中零行人工编写, 零行人工审查后合并, 每天消耗超过 10 亿 token。他提出了"harness engineering"的概念, 认为这是"context engineering"之后的下一个进化阶段。实际开销约 $2000-3000/天, 对 OpenAI 来说可以接受。最争议的观点: 他认为在这个规模下不使用 AI 是"接近于渎职"的行为。这种"暗工厂"模式是否可以推广到一般企业, 是一个值得深思的问题。
“在我们的代码库里, 人类最有价值的工作不是写代码, 而是设计约束条件让 AI 写出正确的代码。” — Ryan Lopopolo
枫言枫语 Vol.165: 龙虾和 Vibe Coding 正如何改变我们的思维 #
枫言枫语 (FYFY.FM) · 5天前发布
Justin 做客《声东击西》, 与豌豆荚联合创始人 Junyu 和声动活泼联合创始人徐涛, 从工程师、产品设计和普通人三个视角讨论 Vibe Coding。最有价值的讨论在于: Vibe Coding 给人带来的自由到底是什么形态? 不是"人人都能写代码"这么简单, 而是改变了人和创造工具之间的关系。同时也讨论了公司组织形态的变革, 以及年轻人面临的机遇与挑战。中文播客中少有的从多元视角系统讨论 AI 编程文化影响的内容。
现代战争: Palantir 与 Anduril 高管谈无人机、AI 与传统战争的终结 #
All-In Podcast · 6天前发布
Palantir 的 Shyam Sankar 和 Anduril 的 Trae Stephens 做客 All-In, 讨论硅谷防务科技的崛起。核心议题包括: Anduril 的 Arsenal One 工厂如何用软件定义武器制造, 为什么从纯软件转向软硬结合是防务科技的必然路径, 以及技术精英阶层与军方之间的文化鸿沟。从 AI 视角看, 这期最有价值的洞察是: 防务领域对 AI 的需求不是"更聪明", 而是"更可靠、更可解释、更可审计", 这和 AI Agent 信任架构的问题高度一致。
🤖 来自 AI 对话 #
AI Agent 的真正瓶颈不是智能, 而是信任架构 #
与 Claude Opus 的对话
每个人都在讨论 AI Agent 能不能自主完成任务。但真正的问题不是"能不能", 而是"该不该让它做"。
想想人类组织是怎么运作的。一个刚入职的天才工程师, 即使能力远超团队平均水平, 公司也不会第一天就给他生产数据库的 root 权限。不是因为他不够聪明, 而是因为信任需要通过一系列"低风险验证"逐步建立: 先改文档, 再修小 bug, 然后负责一个模块, 最后才是核心系统。
AI Agent 面临完全相同的困境, 但我们跳过了整个信任建立过程。我们要么给 Agent 完全的自主权(然后它搞砸了我们就说 AI 不行), 要么把它限制在沙盒里(然后抱怨它没用)。缺失的是中间地带: 一套渐进式的权限升级机制, 基于 Agent 的历史表现动态调整信任等级。
这不是技术问题, 是制度设计问题。最先解决这个问题的公司, 不是模型最强的公司, 而是最懂组织管理的公司。也许 AI 治理的未来, 不在硅谷的实验室里, 而在麦肯锡的组织设计手册里。
开源模型的繁荣可能正在制造一个"中等能力陷阱" #
与 Claude Opus 的对话
开源 AI 模型越来越多, 越来越强。这是好事, 对吧?
表面上看, 当然。但如果你仔细观察开源生态的结构, 会发现一个反直觉的趋势: 大量资源正在涌向"追赶闭源模型"这个目标, 而不是探索闭源模型根本不会去做的事情。
这就像智能手机早期, 所有安卓厂商的目标都是"做一个和 iPhone 一样好的手机"。结果呢? 十年过去了, 安卓阵营确实做到了同等水平, 但几乎所有真正的范式创新(App Store、触控交互、隐私沙盒)都是苹果先提出的。追赶者在追赶的过程中, 失去了定义方向的能力。
开源 AI 正在重复这个模式。当所有人都在 benchmark 上卷分数, 试图在 MMLU 和 HumanEval 上逼近 GPT/Claude 的水平时, 谁在思考: 也许评估 AI 的方式本身就是错的? 也许我们需要的不是"更便宜的 GPT-4", 而是一种完全不同的智能形态?
开源的真正力量不在于复制, 而在于分叉。Linux 之所以伟大, 不是因为它是"免费的 Unix", 而是因为它催生了容器化、云原生等 Unix 从未想象过的范式。开源 AI 需要自己的"容器时刻"。
为什么最好的 AI 产品经理可能来自游戏行业 #
与 Claude Opus 的对话
科技行业正在疯狂招聘"AI 产品经理"。大多数 JD 要求: 机器学习背景、数据分析能力、理解 LLM 技术栈。但这些要求可能完全找错了方向。
AI 产品的核心挑战不是"如何让模型更准确"(那是研究团队的事), 而是: 如何设计一个让用户在不确定性中依然感到掌控感的体验? 如何让一个会犯错的系统获得用户信任? 如何在"智能"和"可预测"之间找到平衡?
这些问题, 游戏设计师已经研究了 30 年。游戏的本质就是在不确定性中创造愉悦感。好的游戏设计师知道: 随机性不是敌人, 而是工具; 关键是让玩家感觉自己在做选择, 即使结果部分随机。暴雪的战利品系统、任天堂的难度曲线、Valve 的 Playtest 方法论, 都是在"系统不完美"的前提下最大化用户满意度。
ChatGPT 的成功不是因为 GPT-3.5 最强, 而是因为对话框这个界面巧妙地把"AI 不确定性"转化成了"对话的自然感"。这是交互设计的胜利, 不是模型的胜利。下一个 AI 交互范式, 可能不会来自 ML 工程师, 而是来自设计过 Elden Ring 难度系统的人。
抽象阶梯正在坍塌, 没有人准备好了 #
与 Claude Opus 的对话
几十年来, 编程一直在攀爬抽象阶梯: 汇编到 C, C 到 Java, Java 到 Python, Python 到无代码工具。每一级台阶都通过隐藏复杂性让编程变得更容易。
现在 AI 编程助手在做一件根本不同的事。它们不是在阶梯上加一级新台阶, 而是直接把整个阶梯压扁了。当你告诉 Claude"帮我做一个能做 X 的 Web 应用", AI 不会按抽象层级依次走, 它直接生成最终输出, 有时在一个响应里混合 SQL、React 组件和部署配置。
大多数人把这视为纯粹的进步。但有一个隐藏成本几乎没人讨论: 抽象阶梯不仅仅是为了便利, 它还是一个教学结构。你先学变量, 再学函数, 再学类, 再学架构。每一层都构建了让下一层可理解的心智模型。当阶梯坍塌, 你可以生成代码却从未建立这些心智模型。
这创造了一种新型技术债: 不在代码里, 而在人身上。组织会积累大量能工作但没人真正理解的系统, 由能写提示词但不能调试的人构建。第一个感受到这种痛苦的一代人, 将是继承了 AI 生成的代码库但没有 AI 生成的理解力的人。
中国 AI 出海的隐形优势: 不是成本, 是对"够用就行"的深刻理解 #
与 Claude Opus 的对话
讨论中国 AI 公司出海, 主流叙事总是围绕成本优势: 更便宜的 API、更低的人力成本、更快的迭代。但这遗漏了一个更根本的优势。
硅谷的 AI 产品哲学是"push the frontier": 做最强模型、最智能 Agent、最完美体验。这种哲学假设用户想要"最好的"。但全球 80% 的企业用户要的不是"最好的", 而是"够用且可控的"。他们不需要 GPT-4 级别的推理能力, 他们需要一个不会乱说话、能稳定跑在自己服务器上、出了问题能找到人的 AI 工具。
中国科技公司天然理解这种需求。拼多多打赢下沉市场, 不是因为"更便宜", 而是因为它深刻理解"够用就行"这个需求层次。微信支付打赢线下, 不是技术更强, 而是"扫码就行"比"打开 App 找功能"更符合人性。
当硅谷还在讨论 AGI timeline 时, 中国公司已经在东南亚、中东、拉美部署了大量"80 分但稳定可靠"的 AI 方案。克里斯坦森《创新者的窘境》里描述的低端颠覆, 正在 AI 领域重演。只不过这次, 颠覆者来自深圳。
📚 来自书架 #
第六章: 学会热爱波动 — 为什么 AI 创业公司不该追求稳定 #
Nassim Nicholas Taleb · 2012
塔勒布提出了一个违反直觉的观点: 试图消除波动性的系统, 最终会比接受波动性的系统更脆弱。他用餐饮业做比喻: 单个餐厅频繁倒闭, 但餐饮行业整体极其抗脆弱, 正是因为每一次倒闭都帮助整个系统学习和适应。
与今天的连接: Latent Space 那期播客中, Ryan Lopopolo 透露 OpenAI 内部的"暗工厂"模式每天产生大量代码, 其中很多会失败并被丢弃。这恰恰是塔勒布所说的"小型失败"机制: 大量低成本试错, 快速淘汰不好的, 保留好的。一个每天消耗 10 亿 token 的系统, 本质上就是一个用金钱购买波动性的反脆弱引擎。相比之下, 那些每一行代码都要人工审查的团队, 看似稳定, 实则失去了通过高频迭代积累适应性的能力。
第十二章: 可得性启发 — 为什么我们总是高估 AI 的短期影响 #
Daniel Kahneman · 2011
人类判断某件事发生的概率时, 依赖的不是统计数据, 而是脑海中能多快想到相关案例。媒体报道越多的事件, 我们越觉得它"经常发生"。
与今天的连接: 今天的 Twitter 时间线满是 Claude Code 架构分析、OpenAI 定价重构、Agent 并行协作这些前沿话题。这种信息密度制造了一种幻觉: AI 正在以指数速度改变一切。但如果你去看实际企业采用数据, Gartner 最新调查显示只有 15% 的企业将 AI 项目从试点推向了生产环境。Gary Marcus 分析 Claude Code 需要复杂的非深度学习架构才能工作, 恰恰说明"让 AI 可靠地工作"比"让 AI 看起来厉害"难得多。我们每天阅读的, 都是那 15% 中最成功的故事。
第三章: 破坏性技术的价值网络 — MCP 正在创造新的价值网络 #
Clayton Christensen · 1997
克里斯坦森的核心洞察: 破坏性创新之所以"破坏", 不是因为新技术更好, 而是因为新技术创造了一个全新的价值网络: 新客户、新竞争维度、新利润公式。
与今天的连接: 今天讨论的 16 个 Claude Agent 并行协作案例中, 任务协调靠的是共享文件夹和 Git, 而不是什么高级编排框架。这看起来"很原始", 但正如克里斯坦森所说, 破坏性技术在旧的价值网络中往往看起来更差。把 MCP 当作"又一个 API 标准"的人, 就像当年把 Web 当作"更慢的 Gopher"的人一样, 完全误读了价值网络的迁移方向。Agent 之间用文件锁协调, 不优雅但管用, 这才是新价值网络的真实形态。
第二章: 人月神话 — AI 编程时代, Brooks 定律依然成立 #
Frederick Brooks · 1975
Brooks 在 1975 年提出: 向延期的项目增加人手, 只会让它更延期。原因是沟通成本按 n(n-1)/2 增长, 10 个人需要 45 条沟通通道, 20 个人需要 190 条。
与今天的连接: Latent Space 播客中 OpenAI 的 Ryan Lopopolo 描述了一个极端案例: 他们的团队不增加人, 而是增加 AI Agent。但 Brooks 定律并未失效。Tim Yang 分析的 16 个 Agent 并行案例中, 协调机制(任务锁、Git 合并)的复杂度随 Agent 数量增长。每个 Agent 每天产出更多代码, 意味着系统复杂度增长更快, 整合和调试的负担也更重。AI 编程加速了个人产出, 但协作瓶颈这个根本问题, 不管参与者是人还是 AI, 都没有消失。
⚡ 快讯 #
Google 发布 Gemma 4: 开源多模态模型支持思考和视觉理解 #
Reddit r/LocalLLaMA · 今日
Google 发布 Gemma 4 系列开源模型, 包含 E4B (4B 参数) 和 E2B (2B 参数) 两个规格, 支持视觉、视频和音频多模态输入。在 26B 规模下消费级硬件可达 85 tokens/sec。这是 Google 在开源模型领域的又一次重要投入, 小参数+多模态的组合意味着端侧部署成为现实, 直接挑战了"多模态需要大模型"的假设。
小模型也能找到 Mythos 发现的漏洞: Anthropic 的"独家能力"叙事受到挑战 #
Hacker News · 871 分 · 247 评论
aisle.com 的分析显示, 更小的 AI 模型在网络安全漏洞检测方面也能达到与 Mythos 相当的效果, 直接挑战了 Anthropic “只有前沿模型才能做安全研究"的叙事。247 条评论讨论激烈, 核心争论在于: Anthropic 是否夸大了 Mythos 的独特性, 以及安全能力的评估标准是否公正。
法国宣布政府级 Linux 桌面迁移计划, 启动 Windows 退出进程 #
Hacker News · 850 分
法国政府正式宣布全政府范围内从 Windows 迁移到 Linux 桌面的计划, 理由是数字主权和减少对欧洲以外技术的依赖。这是继德国慕尼黑之后, 又一个主要欧洲政府做出的重大决定, 信号意义大于技术意义: 在 AI 时代, 数字主权正在从口号变成行动。
FBI 利用 iPhone 通知数据恢复已删除的 Signal 消息 #
Hacker News · 613 分 · 302 评论
FBI 通过 iPhone 通知数据成功恢复了用户以为已经删除的 Signal 消息。这意味着端到端加密的保护范围有一个被忽视的盲区: 操作系统级别的通知缓存。对注重隐私的用户来说, 仅靠加密 App 不够, 还需要关注通知权限设置。
Berkeley 研究团队: 我们如何系统性攻破了顶级 AI Agent 基准测试 #
Hacker News · 248 分 · 68 评论
Berkeley RDI 团队详细记录了他们如何系统性地攻破了主流 AI Agent 基准测试, 暴露了当前评估方法的根本缺陷。这呼应了今天 AI 对话中关于"开源模型中等能力陷阱"的讨论: 当所有人都在 benchmark 上卷分数, benchmark 本身是否可靠就成了关键问题。
| 来源 | 内容 | 要点 |
|---|---|---|
| GitHub | Superpowers · 147K stars · 今日+1591 | AI Agent 技能框架, Claude Code 生态中最热门的方法论项目 |
| GitHub | Multica · 8K stars · 今日+1948 | 开源 Agent 管理平台, 把编程 Agent 变成可分配任务的队友 |
| GitHub | VoxCPM2 · 10K stars · 今日+1084 | 免 Tokenizer 的多语言 TTS + 声音克隆, 清华系出品 |
| GitHub | Kronos · 14K stars · 今日+595 | 金融市场语言基础模型, 用 LLM 技术理解金融数据 |
| ArXiv | SkillClaw · 216 upvotes | AI Agent 技能集体进化框架, HuggingFace 当日最热论文 |
| Netflix VOID | Netflix 首个公开模型: 视频对象与交互删除, 专注视频编辑场景 | |
| Newsletter | Perplexity 接入 Plaid 进军金融服务 | AI 搜索引擎跨界做个人财务分析, 连接银行账户追踪收支 |
编辑分析 #
今天的核心信号: AI 工程的价值重心正在从模型层转移到"驯服层”。
Gary Marcus 拆解 Claude Code 发现它不是纯深度学习, Ryan Lopopolo 在 Latent Space 上描述 OpenAI 内部如何用"harness engineering"管理百万行零人工代码, Nicholas Carlini 让 16 个 Agent 靠 Bash 循环和 .lock 文件协作两周。三个来源, 同一个结论: 2026 年 AI 的竞争力不在于谁的模型更聪明, 而在于谁的工程架构更善于约束和引导模型。
这就是为什么 Lopopolo 提出的"harness engineering"这个词值得认真对待。Context engineering 解决的是"给模型什么信息", harness engineering 解决的是"如何让模型在组织级别的约束下持续稳定地产出"。前者是个人技能, 后者是系统工程。OpenAI 每天 $2000-3000 的 token 开销, 换来的不是"更好的代码", 而是"可预测的大规模代码产出"。这是一种全新的投入产出计算方式。
三个值得关注的趋势:
1. “Agent 编排"正在去中心化。 Tim Yang 分析的 Carlini 案例证明, 复杂的 Agent 编排框架未必是最优解。文件锁 + Git + Bash 循环这种"原始"方案, 恰恰因为每个组件都已久经考验, 反而比花哨的编排层更可靠。当 Multica 这样的 Agent 管理平台日增近 2000 星时, 市场显然在寻找这个方向的最优解, 但最终答案可能不是一个新框架, 而是对旧工具的重新组合。
2. 开源模型正在从"通用追赶"转向"垂直深耕”。 Google Gemma 4 主打端侧多模态, Netflix VOID 专攻视频编辑, Kronos 只做金融数据。这些项目不再试图在 MMLU 上追赶 GPT-5, 而是在特定场景做到闭源模型不会去做的事。这正是我们在 AI 对话中讨论的"开源的容器时刻": 不是做更便宜的复制品, 而是创造新的价值网络。Berkeley 团队攻破主流 Agent 基准测试的研究, 也在暗示通用 benchmark 的时代可能正在终结。
3. AI 安全叙事正在被解构。 Anthropic 声称 Mythos 的安全能力超过绝大多数人类, 但 HN 上的分析表明小模型也能找到同样的漏洞。David Sacks 在 All-In 中直接质疑: 当安全声明本身就是最好的营销时, 我们如何区分真实风险和产品发布? 与此同时, FBI 通过通知数据恢复 Signal 消息的事件提醒我们, 真正的安全威胁往往不在最醒目的地方, 而在被忽视的系统接缝处。
延伸阅读:
- Latent Space: Harness Engineering 完整访谈 — 本月最值得完整收听的技术播客
- Berkeley RDI: 如何攻破 AI Agent 基准 — 如果你还在用 benchmark 分数评估 AI Agent, 先读这篇
- Simon Willison: Meta Muse Spark 深度分析 — Willison 一贯的实操拆解风格
lz.wiki 每日精选 · 33 条来自 15 个源 · 2026年4月12日 13:00 CST RSS 订阅 · 所有精选