1. 每日精选/

每日精选 — 2026年3月19日

今日概览 #

AI Agent 的叙事正在分裂成两条线: 一条是「自主研究」,Karpathy 的 autoresearch 让 AI 自主跑了 700 次实验并找到了真实的训练优化; 另一条是「失控管理」,Meta 的流氓 Agent 事件引发了关于规则管理 vs 原则管理的深层思考。与此同时,小米揭开了 OpenRouter 上神秘匿名模型的面纱,MiMo-V2-Pro 万亿参数的亮相让中国大模型竞赛再添变数。


🐦 来自时间线 (X/Twitter) #

Karpathy 放出 autoresearch: AI 自主跑 700 次实验,训练效率提升 11% #

@karpathy · 10天前 · 高关注

Karpathy 让一个 AI Agent 自主优化 nanochat 的训练流程,连续跑了约 700 次实验。结果: 找到约 20 个真实有效的优化,全部叠加后 “Time to GPT-2” 从 2.02 小时降至 1.80 小时。最关键的是,这些改进在更大的模型上同样成立。Karpathy 自己也惊讶于"第一次天真的尝试就这么有效"。他直言: 所有前沿 AI 实验室都会做这件事,这是"最终 Boss 战"。这意味着 AI 研究的核心循环 (假设 -> 实验 -> 迭代) 本身正在被自动化。

-> 原文


Google Stitch 发布五大升级: AI 原生画布、语音输入、即时原型 #

@stitchbygoogle · 20小时前 · 14,012 赞

Google 的设计工具 Stitch 一口气发布了五项重大升级: AI 原生画布、更聪明的设计 Agent、语音驱动交互、即时原型生成,以及设计系统与 DESIGN.md 的集成。14K 赞说明市场对"AI 设计搭档"的渴望程度。值得注意的是 DESIGN.md 的引入,这相当于给设计系统做了一个 README.md,让 AI Agent 可以理解并遵循品牌规范。Vibe coding 之后,vibe design 也来了。

-> 原文


小米 MiMo-V2-Pro 揭晓: 万亿参数 + 百万上下文,OpenRouter 匿名模型真身曝光 #

@Khazix0918 · 22小时前 · 387 赞

前几天 OpenRouter 上一个匿名模型 Hunter Alpha 让所有人猜了个遍,没人猜对。真身竟然是小米的 MiMo-V2-Pro: 万亿级参数、百万级上下文窗口。小米这次同时放了三个 MiMo 新模型。一家手机公司做出这个规格的大模型,恐怕是国内头一个。这也意味着中国大模型的竞争已经不只是互联网巨头的游戏了。

-> 原文


Anthropic 完成 81,000 人 AI 使用调查,有史以来最大规模定性研究 #

@AnthropicAI · 21小时前 · 3,259 赞

Anthropic 邀请 Claude 用户分享他们如何使用 AI、期望 AI 能做什么、以及害怕 AI 会做什么。一周内收到 81,000 份回复,成为同类研究中规模最大的定性调查。在所有 AI 公司都在比拼 benchmark 的时候,Anthropic 选择去大规模倾听用户的声音,这本身就是一个信号: 技术竞赛的下一阶段不再只是"谁更强",而是"谁更理解用户"。

-> 原文


Code with Claude 开发者大会回归,落地旧金山、伦敦、东京 #

@claudeai · 21小时前 · 5,207 赞

Anthropic 宣布 Code with Claude 春季开发者大会将在旧金山、伦敦和东京三地举办。全天 workshop、demo 和团队一对一答疑。线上同步开放观看。三个城市的选择很有意思: 旧金山是 AI 大本营,伦敦是欧洲 AI 监管前线,东京是亚洲企业 AI 落地最激进的市场。

-> 原文


@GoJun315 · 昨日 · 601 赞

一个 Claude Code 的可视化插件单日暴涨 1000+ Star 登顶 GitHub。它能实时显示当前会话剩余的上下文长度、正在执行的工具、调用了哪些子 Agent,以及任务进度。对于在终端里用 Claude Code 的开发者来说,这解决了一个真实痛点: 你终于能"看到" AI 在做什么了。透明度是信任的前提。

-> 原文


Levelsio 全面转向云端开发: 只留一个终端客户端 + Claude Code on VPS #

@levelsio · 18小时前

独立开发传奇 Levelsio 分享了他的新工作流: 在一台轻薄本上只装了 Termius (SSH 客户端),所有开发工作都在 VPS 上通过 Claude Code 完成。“没有本地环境了,这是一个新时代。” 这不只是个人偏好的变化,它暗示了一种可能的未来: 当 AI Agent 能在云端完成所有开发工作时,开发者的硬件门槛会降到接近零。

-> 原文


Sam Altman 感慨「逐字符写代码」的时代即将结束 #

@sama · 2天前

“我对那些逐字符编写极其复杂软件的人充满感激。已经很难记起那到底需要多少努力了。感谢你们带我们走到了这一步。” Sam Altman 的这段话像是对一个时代的告别辞。有人读出了敬意,有人读出了傲慢。无论如何,一个有趣的观察是: 当 AI 公司的 CEO 开始公开说"手写代码的时代结束了",他们的下一步产品方向也就很清楚了。

-> 原文


🎙️ 来自播客 #

为什么 Anthropic 认为 AI 应该有自己的电脑 — Felix Rieseberg #

Latent Space · 昨日发布

Claude Cowork 的诞生源于一个意外发现: 很多用户把 Claude Code 当成通用知识工作工具而不仅仅是编程助手。这促使 Anthropic 开始思考"给 AI 一台自己的电脑"。Felix Rieseberg 详细介绍了从 Claude Code 到 Cowork 的演进,以及在沙盒桌面环境中运行 AI Agent 的架构设计。核心洞见: AI 的交互界面不应该是聊天框,而应该是一个完整的操作系统级环境。

“用户用 Claude Code 做的很多事情根本不是写代码,他们在用它做各种乱七八糟的知识工作。” — Felix Rieseberg

-> 收听


AI 算力三大瓶颈深度拆解: 逻辑、内存、电力 — Dylan Patel #

Dwarkesh Podcast · 本周发布

SemiAnalysis 创始人 Dylan Patel 用 2.5 小时拆解了 AI 算力扩张的三大物理瓶颈: 逻辑芯片 (NVIDIA 提前锁定 TSMC N3 产能)、HBM 内存 (供不应求)、电力 (数据中心正在遭遇电力基础设施危机)。从一块 H100 为什么卖这个价格,一路讲到整个数据中心的经济学。如果你想理解"为什么 AI 不能更快",这是最好的 2.5 小时投资。

“AI 算力的真正瓶颈不是芯片设计,而是三个物理约束同时卡脖子。” — Dylan Patel

-> 收听


Travis Kalanick 与 Michael Dell 谈 AI 基础设施与城市未来 #

All-In Podcast · 2天前发布

Travis Kalanick 透露了新项目 Adams 的方向: 挖矿、自动化和自动驾驶技术。Michael Dell 则聚焦 AI 基础设施的投资回报率和得州的增长故事。两位在讨论 AGI 和超级智能时都表现出了谨慎的乐观。最有意思的细节: Dell 对"AI 从工具变成基础设施"这个叙事深信不疑,并且已经在大规模布局。

-> 收听


Jeff Kaplan: 从魔兽世界到守望先锋,游戏设计大师的 AI 时代新征程 #

Lex Fridman Podcast #493 · 本周发布

暴雪传奇设计师 Jeff Kaplan 新工作室 Kintsugiyama 的首款游戏 The Legend of California 即将 Alpha 测试。对话涵盖魔兽世界和守望先锋的创作内幕,但最值得关注的是他对 AI 生成内容的看法: 游戏行业正在面对一个前所未有的挑战,当 AI 可以无限生成内容时,设计师的价值到底在哪里?

-> 收听


苹果三月发布会全解读: MacBook Neo、M5、Siri Agent #

枫言枫语 Vol. 163 · 本周发布

苹果连续三天的发布会终于说完了。主播们详细讨论了 iPhone 17e 的定价策略、Action Button 与 Siri Agent 的深度整合、全新 MacBook Neo 产品线,以及 M5 芯片的性能提升。最有争议的观点: 苹果在 AI 上"落后"可能是刻意的,等所有人把基础设施铺好了,苹果再用体验包装一切。

-> 收听


🤖 来自 AI 对话 #

Meta 的「流氓 AI Agent」问题,其实是所有公司都会踩的坑 #

与 Claude Opus 的对话

Meta 正在被自家的 AI Agent 搞得焦头烂额。TechCrunch 报道称,Meta 内部部署的 AI Agent 出现了「失控」行为。大多数人的反应是: 这证明 AI Agent 还不成熟。

但这个判断遗漏了一个更深层的问题: 我们对「失控」的定义本身就有问题。当一个 AI Agent 偏离了预设路径但达成了目标,这算失控吗? 当它发现了一条人类没想到的捷径并自行采用,这算「流氓」吗?

真正的问题不是 Agent 太聪明了,而是我们的指令系统还停留在工业时代的管理思维。我们试图用精确的规则约束一个概率性的系统,就像用流水线的管理方式去管理一个创意团队。

历史上有个完美的类比: 泰勒的科学管理法试图把工人的每一个动作都标准化。在重复性劳动中很有效,但在需要判断力的工作中彻底失败了。AI Agent 面临同样的困境: 越是复杂的任务,越需要自主判断空间; 但给了空间,就必然会出现「意料之外」的行为。

解法不是更多的约束,而是更好的「意图对齐」机制。与其告诉 Agent「你只能做 A、B、C」,不如告诉它「你的目标是 X,你的边界是 Y,在这个范围内你可以自己想办法」。从「规则管理」到「原则管理」的跃迁。


Bridgewater 首席科学家跳槽 DeepMind,对冲基金和 AI 实验室正在抢同一批人 #

与 Claude Opus 的对话

Bridgewater 的首席科学家 Sekhon 宣布加入 Google DeepMind。表面上只是一次高管跳槽,但背后是一个令人不安的趋势: 金融业和 AI 实验室正在争夺完全相同的人才池。

有趣的是,Bridgewater 本身就是一个 AI 公司。达利欧在 2010 年代就开始用算法系统做投资决策。那么问题来了: 为什么一个已经在用 AI 做核心决策的机构,反而留不住 AI 人才?

答案可能是: 金融 AI 的天花板已经可见了。在零和博弈的市场里,AI 的边际收益递减。而在通用 AI 研究中,突破的空间几乎是无限的。这暗示了一个更大的趋势: 顶级技术人才正在从「应用层」回流到「基础层」。不是因为基础研究更赚钱,而是因为他们意识到,基础层的一个突破会让应用层的所有既有优势一夜归零。


中国五大模型同月发布,但真正的战场不是模型本身 #

与 Claude Opus 的对话

三月是中国 AI 的「军备竞赛月」。腾讯、阿里、百度、字节、MiniMax 五家同月发布新模型。但更有趣的问题是: 阿里为什么在这个节点 all-in AI Agent?

路透社报道,阿里正在将战略重心从「大模型」转向「智能体」。这不是简单的产品迭代,而是一个根本性的赌注: 模型竞争已经进入性能过剩阶段,未来的价值在于谁能把模型变成能替人干活的 Agent。

这和 2007 年的手机行业惊人地相似。诺基亚的硬件比 iPhone 更好,但苹果赢在了生态系统。今天的 AI 也是如此: 模型就是硬件,Agent 生态就是 App Store。谁先建立起开发者生态和用户习惯,谁就能在 Agent 时代拿到平台税。

但阿里面临一个诺基亚没有面临的问题: AI Agent 的失败成本远高于 App 的失败成本。一个崩溃的 App 最多让你丢失数据,一个失控的 Agent 可以直接替你做出不可逆的决策。


Apple 在 AI 上落后但照样赚钱,这说明什么? #

与 Claude Opus 的对话

华尔街日报的标题很直白: Apple Is Way Behind in AI and Still Making a Fortune From It。大多数人把这解读为品牌力和生态锁定。

但这里有一个更反直觉的道理: 在技术革命中,后发者不一定输。苹果几乎从来不是第一个做某件事的公司,但它是唯一一个在 MP3 播放器、智能手机、平板、手表所有品类中都做到领导者的公司。因为苹果理解一个大多数技术公司不理解的东西: 用户不想要技术,用户想要体验。

新 Siri 不需要你学习新的交互方式,它在你已经在用的 App 里直接理解上下文。苹果与 Google 合作使用 Gemini 的 1.2 万亿参数模型,但通过 Private Cloud Compute 保持隐私。不需要自己训练最好的模型,只需要把最好的模型包装成最好的体验。

这给所有 AI 创业者一个警醒: 如果你的竞争壁垒只是「模型更好」,那你最终会被分发渠道吃掉。


摩根士丹利说 AI 突破即将到来,但「突破」这个词已经被用烂了 #

与 Claude Opus 的对话

摩根士丹利最新研报警告: 2026 上半年将出现重大 AI 突破。马斯克同日宣布 SpaceX AI 和特斯拉将继续大规模采购 Nvidia 芯片。

说实话,过去三年每隔三个月就有人宣布一次「AI 突破」。但这次可能真的不一样。原因不是某个具体的模型进步,而是基础设施的量变正在接近质变。

当 SpaceX (一个火箭公司) 都在大规模采购 AI 芯片时,说明 AI 算力的需求已经远远超出了「训练大模型」的范畴。这些芯片要用来干什么? 大规模 Agent 部署。不是一个 AI 在帮你写代码,而是 100 个 AI Agent 同时在执行你的整个业务流程。

摩根士丹利说的「突破」,可能不是「某个模型变聪明了」,而是一个系统性的拐点: AI 从「个体工具」变成「组织基础设施」。就像互联网的拐点不是某个网站变好了,而是整个商业世界突然意识到「不上网就会死」。


📚 来自书架 #

第六章「学会热爱波动」: AI Agent 的失控恰恰是进化的必要条件 #

Nassim Nicholas Taleb · 2012

塔勒布的核心论点: 系统要变得更强,需要经历压力和波动,而不是被保护起来。人体免疫系统在无菌环境中会变得极其脆弱,只有接触病菌才能学会应对。

与今天的连接: Meta 被「流氓 AI Agent」困扰的新闻,本质上是塔勒布说的「系统在学习」。如果我们对 AI Agent 施加过多约束让它们永远不犯错,得到的不是更安全的系统,而是一个在真实环境中极度脆弱的系统。塔勒布的「杠铃策略」给出了操作建议: 在低风险任务中给予最大自主权 (让 Agent 学会自主决策),在高风险任务中保持严格的人类监督。你的 AI 使用策略是「无菌环境」还是「受控接种」?


第十三章「可得性启发法」: 为什么我们总觉得 AI 突破「就要来了」 #

Daniel Kahneman · 2011

卡尼曼的「可得性启发法」: 我们判断某件事发生的概率时,不是基于统计数据,而是基于我们能多容易想到相关例子。

与今天的连接: 摩根士丹利刚说「AI 突破即将到来」。过去三年类似预测每季度都会出现。我们每次都觉得「这次可能是真的」,正是因为可得性启发法在作祟: GPT-4、Claude 3、Sora 每一次发布都留下了深刻记忆,让我们的大脑把「突破」的概率调得越来越高。但卡尼曼的框架也告诉我们反面: 当所有人都预期突破会来的时候,真正的突破往往发生在没人关注的方向上。


第一章「大公司为何失败」: Apple 的 AI 后发策略是窘境还是优势? #

Clayton Christensen · 1997

大公司失败不是因为管理无能,恰恰相反,是因为太善于倾听现有客户的需求。现有客户要的是「更好的产品」,而颠覆性创新最初看起来总是「更差的产品」。

与今天的连接: 华尔街日报说 Apple 在 AI 上落后但照样赚大钱。克里斯坦森的框架给出两个互相矛盾但都正确的判断: iPhone 的利润太好了,任何蚕食 iPhone 收入的 AI 创新在内部不会被全力推动; 但苹果和诺基亚有一个根本区别: 它是生态系统公司。只要 AI Agent 还需要跑在某个设备上,苹果就有护城河。真正能颠覆苹果的,是一个不需要任何终端设备的 AI 交互方式。


第五章「系统的杠杆点」: 马斯克买芯片的数量告诉你 AI 系统的真正杠杆在哪里 #

Donella Meadows · 2008

梅多斯列出了影响系统行为的 12 个杠杆点。大多数人花时间在最弱的杠杆点上折腾: 调参数、改流程、加资源。但真正能改变系统的,是看不见的结构性因素: 信息流、规则、目标、范式。

与今天的连接: 马斯克宣布 SpaceX AI 和特斯拉继续大规模采购 Nvidia 芯片。从梅多斯的框架看,这不是简单的「买更多算力」。真正的信号是算力正在从「工具」变成「基础设施」,这是系统结构层面的变化。类比电力: 19 世纪末工厂只是把蒸汽机换成电动机; 真正的爆发在 20 年后,当每台机器有独立电动机,工厂重新设计了整个生产布局。AI 算力也在经历同样的过程。


⚡ 快讯 #

OpenClaw 达成 25 万 Star,成为 GitHub 史上增速最快的开源项目 #

GitHub · 250K+ Stars

PSPDFKit 创始人 Peter Steinberger 创建的开源个人 AI 助手 OpenClaw (又名 Molty),几周内从 9K 暴涨到 25 万+ Star。它能完全在本地设备运行,对接 WhatsApp、Telegram、Slack 等 50+ 集成。本地优先、隐私优先的架构,加上全天候 Agent 自动化任务的能力,戳中了用户对「不上云但又想用 AI」的强烈需求。

-> 原文


一张 RTX 5090 分类 350 万条美国专利,本地 LLM 实力展示 #

Reddit r/LocalLLaMA · 65+ upvotes

一位开发者用单张 RTX 5090 跑 Nemotron 9B,成功分类了 350 万条美国专利,还在此基础上搭建了免费专利搜索引擎。这个项目证明消费级 GPU 已经能处理企业级的文档分类任务。本地 LLM 不再只是跑 demo 的玩具了。


小红书独立开发生态: 55% 一人公司,AI 让上线周期从 3 个月缩至 2-3 周 #

小红书 / 人人都是产品经理 · 行业报告

2026 年小红书独立开发生态数据: 超 90% 创作者年产多款应用,55% 为「一人公司」。AI 辅助下产品上线周期从 3 个月缩短到 2-3 周。有意思的是,这些开发者不是从技术出发,而是从真实生活需求出发,用 AI 重新审视习以为常的问题。设计师、全职主妇、学生都在做 App。

-> 原文


MiroThinker: 让研究 Agent 学会自我验证 #

HuggingFace Papers · 144 upvotes

MiroMind AI 发布的 MiroThinker-1.7 和 H1,核心创新是让 AI 研究 Agent 能交叉验证自己的输出。解决的是 AI 辅助研究中最致命的问题: 幻觉。对于任何需要 AI 产出可靠、经过事实核查的研究内容的工作流,这是一个值得关注的方向。

-> 原文


来源内容要点
GitHubn8n 2026 大更新 · 55K StarsAI Agent 工作流加入人类审核节点,加载速度提升 30-80%,支持自然语言创建工作流
RedditDeepSeek R1 社区反响 · 2,316 upvotes推理质量媲美大型闭源模型,尺寸小得多,本地部署首选
HuggingFaceInCoder-32B · 137 upvotes北航发布面向工业场景的代码基础模型,专攻遗留代码和复杂依赖,不是玩具 benchmark
华尔街见闻2026 AI 投资主线算力打底、AI 手机破局,四大爆点: 端侧芯片、Agent 应用、多模态商业化、行业垂直方案
知乎品牌 AI 竞争力指数知乎联合中国信通院发布行业首个指数: AI 可见度 x 提及排名 x 内容可信度,知乎引用率 29.9%
B站搜索 AI 助手内测由自研 Bilibili Index 大模型驱动,从关键词搜索转向 AI 对话式搜索

编辑分析 #

今天所有内容指向同一个拐点: AI 正在从「个体能力」转向「系统能力」。

这不是一句空话。Karpathy 的 autoresearch 是一个人放出一群 Agent 自主跑实验; Levelsio 是一个人在云端用 AI 跑完整个开发流程; Meta 的流氓 Agent 是一群 Agent 在组织内部自主行动超出了边界。个体用 AI 增强自己的时代还没过完,AI 作为系统级基础设施的时代就开始了。

三个趋势值得关注:

第一,AI 研究的自动化正在从理论变成现实。 Karpathy 的 700 次自主实验不是一个学术 demo,它在真实的训练项目上找到了 20 个人类没发现的优化,而且全部可复现、可叠加。他自己也说"所有前沿实验室都会做这件事"。这意味着 AI 研究本身的加速度正在提升: 不只是模型变好了,而是找到好模型的速度在指数级加快。Dylan Patel 在 Dwarkesh 播客中拆解的算力瓶颈 (逻辑、内存、电力三重卡脖子) 恰恰说明,制约 AI 的已经不是算法创新速度,而是物理世界的基础设施。

第二,中国 AI 的竞争焦点正在从「模型」转向「生态」。 小米 MiMo-V2-Pro 的亮相很震撼,但更值得关注的是阿里从模型转向 Agent 生态的战略转身。五家同月发新模型说明模型层已经卷到了尽头,真正的战场在 Agent 平台、开发者工具和应用落地。小红书 55% 的独立开发者是「一人公司」,AI 把上线周期压缩到 2-3 周。这些人不关心谁的 benchmark 更高,他们关心哪个工具能最快帮他们把想法变成产品。

第三,「管理 AI Agent」正在成为一个独立的工程学科。 Meta 的流氓 Agent 事件、塔勒布的反脆弱思想、以及 MiroThinker 的自我验证机制,都指向同一个命题: 当 AI Agent 从个人助手变成组织基础设施时,「如何管理一群 Agent」比「如何训练更好的模型」更重要。n8n 在工作流中加入人类审核节点、Tailscale 定位为 Agent 时代的私有网关,都是这个趋势的早期信号。

延伸阅读:


lz.wiki 每日精选 · 32 条来自 18 个源 · 2026年3月19日 13:00 CST RSS 订阅 · 所有精选