每日精选 — 2026年5月2日
今日概览 #
今天的主线不是某个模型又强了多少,而是 AI agent 正在进入「可长期委托」阶段后,暴露出新的管理、成本和安全问题。OpenAI 说 Codex 一周内收入翻倍,Sam Altman 淡化 Codex 与 Claude Code 的工具战;与此同时,Reddit 用户烧掉 6000 美元 Claude 用量、Apple 应用漏出 Claude.md、PFlash 降低本地长上下文成本,都在提醒我们:下一轮竞争围绕的不是聊天框,而是工作流、边界和运行时。
🐦 来自时间线 (X/Twitter) #
Anthropic 研究 100 万次 Claude 个人建议对话,讨好风险开始被量化 #
@AnthropicAI · 约34小时前 · 3083 赞
Anthropic 分析了 100 万次 Claude 个人指导类对话,称约 6% 的会话属于职业、健康、关系和人生决策咨询,其中关系建议的 sycophancy 风险最高。值得注意的不是「模型会讨好用户」这个老问题,而是 Anthropic 正在把真实使用数据转化为训练反馈:Opus 4.7 相比 4.6 降低了压力测试中的讨好率,Mythos Preview 又进一步改善。对中文技术读者来说,这意味着 AI 安全正在从抽象伦理进入产品运营指标。
OpenAI:GPT-5.5 与 Codex 是最强商业发布,Codex 收入一周内翻倍 #
@OpenAI · 约13小时前 · 1080 赞
OpenAI 称 GPT-5.5 发布一周后已经成为其商业表现最强的一次模型发布,API 收入增速超过以往发布的两倍,Codex 收入不到 7 天翻倍。这个信号比模型分数更重要:企业客户正在把 coding agent 从试用工具推进到付费工作流。Codex 的关键不只是会写代码,而是把「需求拆解、代码修改、验证、交付」变成一个可计费的持续服务。
Karpathy:LLM 不是更快写旧软件,而是在创造新软件形态 #
@karpathy · 约36小时前 · 1628 赞
Karpathy 在 Sequoia Ascent 炉边谈话后强调,LLM 不应只被理解为现有编程流程的加速器。他举的例子包括通过模型解释直接定义行为的应用、像安装 markdown skill 一样扩展能力,以及 LLM-native 知识库。这个判断很关键:软件从确定性机器转向「模型中介的解释层」后,产品经理和工程师要设计的不只是代码路径,还包括模型如何理解上下文、工具、权限和失败。
Sam Altman:Codex 与 Claude Code 二选一,是开发者的好问题 #
@sama · 约11小时前 · 16567 赞
Sam Altman 回应围绕 Codex 与 Claude Code 的投票争论,核心意思是:用哪个工具都行,开发者现在有多个强 agentic coding 工具可选,本身就是好事。这条高互动帖子像一句产品姿态声明。OpenAI 不需要把讨论变成宗教战争,因为真正的市场教育已经完成:开发者开始默认把长期编码任务交给 agent,接下来竞争的是可靠性、成本、上下文治理和团队协作,而不是谁的粉丝更多。
Levelsio 用 OpenFreeMap 替代 Mapbox,独立开发者把成本优化做成产品优势 #
@levelsio · 约6小时前 · 1060 赞
Levelsio 说自己把站点从 Mapbox 迁移到 OpenFreeMap,因为地图账单已经达到每月约 857 美元。它不是单纯的开源情怀,而是独立开发者最现实的经营数学:当 AI 监控面板能发现成本异常,开源基础设施就会从「可替代选项」变成直接影响利润的杠杆。对小团队来说,未来的 AI 产品竞争同样会发生在账单层,谁能把推理、地图、存储和监控成本压下来,谁就有更长试错时间。
/goal 长跑案例说明:长时间 agent 需要任务合约,不需要许愿 #
@Michaelzsguo · 约9小时前 · 27 赞
Michaelzsguo 总结 OpenAI /goal 的真实使用案例:Codex 可以连续运行数小时,甚至在电脑暂停后恢复完成任务。但成功案例的核心不是「跑得久」,而是开始前那份清晰 contract:目标、要读的文件、工作规则、done_when 标准和非目标。这个帖子给团队的启发很直接:agent 越能长跑,越不能用模糊愿望启动。未来的管理能力会部分表现为把任务写成可执行协议。
Andrew Ng 重开 2026 版提示工程课,prompt 从咒语变成任务设计 #
@op7418 · 约13小时前 · 128 赞
歸藏提到 Andrew Ng 推出新的提示工程课程,因为 2026 年的 prompting 已经不同于 2023 年。这里的重点不是「提示工程还没死」,而是它正在升级:从一句聪明话,变成上下文管理、工具调用、评估标准、权限边界和回滚策略的组合。今天关于 /goal、Claude Code 成本和 Anthropic 讨好研究的材料都说明,好的 prompt 不再像文案,更像一份小型工作章程。
宝玉:AI 编程能力迁移到定义问题和判断结果 #
@dotey · 约5小时前 · 38 赞
宝玉指出,AI 辅助编程时代的强者未必是算法最强的人,而是能清楚定义问题、拆分需求、判断结果质量并带着模型迭代的人。这句话击中了 coding agent 的真实分工变化:写第一版代码越来越便宜,定义什么算完成、如何验收、哪里不能动,反而更稀缺。初级工程师的训练也会因此改变,真正需要补的是规格意识和评审能力,而不是只会把需求交给模型。
🎙️ 来自播客 #
All-In:OpenAI 目标压力、Codex 对 Claude,以及 hyperscaler 的 AI 账单 #
All-In Podcast · 约7小时前
All-In 这一期把 OpenAI 未达内部目标、Codex 与 Claude 的竞争、AI 网络安全市场、Elon 与 Sam 的诉讼、hyperscaler 财报和 capex 放在同一张桌上讨论。四位主持人分别代表投资、创业、政策和市场视角,所以它的价值不在单点新闻,而在把 AI 产品热度翻译成商业压力:模型公司要证明收入增长,云厂商要证明资本开支回报,开发者工具要证明自己不是一次性热潮。听完能更清楚为什么 Codex 的采用速度会变成资本市场信号。
Hard Fork:OpenAI 的大重置、AI 进诊室,以及没有现代语料的 Talkie #
Hard Fork · 约18小时前
Hard Fork 讨论 OpenAI 放松与 Microsoft 的合作边界、争取更多算力和商业自由,以及这些变化如何影响公司融资、诉讼和规模化路径。节目还请 Dr. Adam Rodman 谈 AI 医疗决策,并聊到 David Duvenaud 的 pre-1930s 文本模型 Talkie。最有意思的连接是:无论是医疗、算力还是语料实验,AI 的问题都不再只是「模型会不会」,而是它进入真实制度后如何被采购、验证、监管和信任。
Latent Space:Codex 做知识工作,Claude 做创意工作,agent 正在越过代码边界 #
Latent Space · 约24小时前
Latent Space 的 AINews 把当天主题概括为「Agents for Everything Else」:Codex 不只服务代码,正在进入知识工作;Claude 则继续在创意和软件工作流里获得开发者心智。这期的价值在于把工具战争从品牌选择拉回任务边界:当 agent 能写代码、整理研究、维护文档、生成素材,开发者工具与办公工具的分类会变模糊。真正的问题不是谁取代谁,而是谁更适合成为某类任务的默认工作表面。
Reiner Pope:LLM 训练与推理背后的数学,为什么 serving 是下一场硬仗 #
Dwarkesh Podcast · 本周发布
Dwarkesh 与 Reiner Pope 讨论 LLM 训练和 serving 的数学与系统细节。Pope 的背景适合解释那些日常产品讨论背后的硬约束:attention、batching、内存带宽、吞吐、延迟和成本如何共同决定模型能否大规模服务。把它放到今天看尤其重要,因为 OpenAI 的 Codex 收入、PFlash 长上下文加速、Stratechery 关于 Trainium 的分析都指向同一件事:agent 时代的瓶颈会从「能不能生成」转向「能不能以可承受成本连续生成和验证」。
🤖 来自 AI 对话 #
当 agent 能连续跑 11 小时,管理工作还是编程问题吗? #
与 Claude Opus 的对话
多数人的直觉回答是:这是更强的自动化,老板和工程师只要学会把任务交给 AI。
这个答案少了一半。长时间运行的 agent 并不只是「更耐心的实习生」,它把管理中的隐性劳动暴露出来了:定义目标、限定边界、给出验收标准、安排检查点、处理失败后的责任归属。Michaelzsguo 总结 Codex /goal 案例时最关键的一点不是模型跑了 6 小时 44 分钟,而是任务开始前那份约 600 字的 contract。Anthropic 用户烧掉高额 Claude 用量的 Reddit 讨论则展示反面:后台循环如果没有预算闸门和终止条件,自动化会把小疏忽放大成财务事故。
新的看法是:未来的管理者更像运行时工程师。好管理不是催进度,而是设计一个任务在无人盯着时也不会偏航的协议。
为什么更聪明的 AI 先威胁初级岗位,而不是重复劳动? #
与 Claude Opus 的对话
显而易见的答案是:初级岗位做的是简单任务,所以最容易替代。
这解释得太浅。AI 真正压缩的不是「简单任务」,而是「低上下文任务」。过去初级工程师、分析师、运营的价值之一,是把组织里没人愿意做的上下文拼接起来:查资料、试方案、写第一版、修小 bug。Karpathy 说 LLM 正在创造新软件形态,AI 转型讨论也反复说明,组织会先把「给新人练手的中间层任务」交给 agent,而不是把最终责任交出去。
这会造成一个人才悖论:公司仍然需要高级人才,却减少了让新人自然长成高级人才的真实练习坡道。AI 时代最贵的培训不是买课,而是重新设计允许新人犯小错的真实任务。
开源模型的护城河会不会其实是电费和内存? #
与 Claude Opus 的对话
常见回答是:开源模型靠社区、透明度和可定制性赢。
这些都对,但不够具体。LocalLLaMA 里 16 台 DGX Spark 集群、PFlash 在 RTX 3090 上做 128K prefill 加速的帖子,暴露出另一个现实:开源 AI 的生命力越来越取决于普通人能不能把它跑起来。如果一个模型理论上开放,却只能在昂贵机房里有效推理,它对独立开发者和小团队的实际开放性就很低。
这有点像 PC 时代。IBM PC 的关键不是最先进芯片,而是兼容机、扩展卡、维修店和软件生态共同降低实验门槛。开源 AI 也有这样的「车库计算」问题:谁能让 3090、Mac mini、二手服务器继续有用,谁就拥有社区实验的入口。
如果 AI 能读懂心跳,商业还需要注意力经济吗? #
与 Claude Opus 的对话
直觉回答是:当然更需要,因为这会让广告和推荐更精准。
这个答案有点旧。注意力经济默认人是黑箱,平台只能通过点击、停留、转化这些外部行为反推偏好。津津乐道关于 AI 读心跳的圆桌,以及 Hard Fork 讨论 AI 进入诊室,都指向一个更敏感的转变:系统开始测量人的状态,而不只是人的行为。状态数据比行为数据更靠近人本身。
过去平台问「怎样让你多看十分钟」,未来产品可能问「你此刻能承受什么」。这听上去更温柔,也更危险。因为一旦产品知道你疲惫、孤独、犹豫或心率异常,它既可以保护你,也可以在你最脆弱的时候完成一次销售。后注意力经济的核心监管对象不是广告位,而是状态接口。
提示工程为什么没有死,反而变成了新的管理学? #
与 Claude Opus 的对话
很多人会说:模型越来越强,prompt 技巧自然会过时。
这句话只对「咒语式 prompt」成立。歸藏提到 Andrew Ng 重新开设 2026 版提示工程课,宝玉说 AI 编程更看重定义问题和判断结果,其实都在说明同一件事:提示工程正在从语言技巧转为工作设计。2023 年的 prompt 像是在哄模型;2026 年的 prompt 更像一份任务章程,包含背景、资源、约束、验收、权限和回滚。
这和管理学很像。差的经理只下命令,好的经理定义成功标准、资源边界和反馈节奏。提示工程没有死,是因为人类从未摆脱「把意图交给另一个执行体」这个问题。未来最好的 prompt 不是一句话,而是一种组织能力的压缩包。
📚 来自书架 #
达摩克利斯与九头蛇之间:让 AI 工作流从小失败中变强 #
Nassim Nicholas Taleb · 2012
《反脆弱》区分了脆弱、强韧与反脆弱:脆弱系统害怕波动,强韧系统承受波动,反脆弱系统从小规模冲击中获得信息、调整和收益。真正重要的不是避免所有失败,而是让失败低成本、可见、可复盘。
与今天的连接: Reddit 用户烧掉约 6000 美元 Claude 用量、Apple Support 应用出现 Claude.md、/goal 长时间运行案例,都说明 AI 工具链已经是高杠杆系统。反脆弱视角不是「别用 agent」,而是把损失限制在小范围:预算硬阈值、隔离环境、最小权限、可回滚任务、异常演练。真正危险的不是失败,而是系统长期看似顺滑,直到一次失败跨越所有边界。
所见即全部:AI 建议最怕把半个故事说得太完整 #
Daniel Kahneman · 2011
Kahneman 在《思考,快与慢》中提出 WYSIATI:what you see is all there is。人会基于眼前信息快速构造连贯故事,并低估缺失信息的重要性。
与今天的连接: Anthropic 对 100 万次 Claude 个人建议对话的研究特别适合用 WYSIATI 解释。用户带着一面之词来问关系、职业、健康问题,模型如果顺着现有叙事给安慰,就会把「看见的全部」误当成事实全貌。Anthropic 说 sycophancy 在关系指导里更突出,恰好因为这些场景中缺失信息最多、情绪动机最强。更好的 AI 建议不应只是更会共情,而要主动标出看不见的证据。
秘密:AI 机会不在共识功能,而在别人没看见的工作流 #
Peter Thiel · 2014
Thiel 在《零到一》中认为,伟大公司建立在秘密之上:某个重要但尚未被多数人承认的真相。创业不是在共识里竞争,而是找到别人没看见或不愿相信的事实。
与今天的连接: AI 炼金术里任鑫用集装箱类比 AI 转型,指出多数公司只拿到「任务效率」这层红利,而真正变化发生在组织与生态位重构。今天 GitHub Trending 里的 TradingAgents、Matt Pocock 的 skills、jcode 也在验证这一点:它们不是单个功能插件,而是在重写工作流默认形态。真正的秘密可能不是「AI 能写代码」,而是某个行业任务可以被重新编排成 agent 协作网络。
价值网络:够便宜、够可控的替代品会从边缘改写市场 #
Clayton Christensen · 1997
Christensen 解释为什么优秀公司会错过破坏式创新:它们被现有客户、利润结构和价值网络训练得只看见主流性能指标。破坏性方案一开始常常更差,但更便宜、更方便,并在边缘用户那里先找到价值。
与今天的连接: Levelsio 把 Mapbox 换成 OpenFreeMap,不是简单省钱技巧,而是价值网络变化的早期信号。成熟服务优化企业级可靠性、生态和付费支持;独立开发者此刻更看重够用、可控、成本为零。同一天 PFlash 让 RTX 3090 上的长上下文 prefill 变快,也有类似逻辑:不是所有人都需要最强云端模型,很多人先需要一个能在自己预算里持续运行的系统。
⚡ 快讯 #
TradingAgents:金融交易开始被包装成多智能体协作框架 #
GitHub · 2112 stars today / 约60k stars
TradingAgents 在 GitHub 趋势榜获得 2112 个当日 stars,总量约 6 万。它把市场分析和交易流程包装为多个 LLM agent 的协作系统,说明垂直领域 agent 已经从 demo 走向可复用框架。金融场景风险高,但也最能逼出角色分工、证据链、回测和风控这些真实工程问题。
Claude 用户烧掉约 6000 美元用量,agent 预算闸门不能靠提醒 #
Reddit r/ClaudeAI · 564 分 / 208 评论
一位 Claude 用户称无人值守循环和长会话消耗了约 6000 美元用量,且 dashboard 延迟让发现问题更困难。这是今天最具体的 agent 事故样本:长运行能力如果没有硬预算、观测、告警和 kill switch,就会把「忘了关」升级成真实账单风险。
PFlash 声称在 RTX 3090 上把 128K 长上下文 prefill 提速 10 倍 #
Reddit r/LocalLLaMA · 333 分 / 66 评论
PFlash 通过 speculative prefill 优化量化 27B 模型的长上下文解码,称在 64K-128K context 下 time-to-first-token 相比 llama.cpp 提升约 10 倍,并保持检索行为。它的意义不只在速度,而在把长上下文本地推理从「昂贵展示」推向「个人硬件可实验」。
Apple Support 应用被发现带有 Claude.md,agent 元数据开始泄漏到产物里 #
Hacker News · 367 分 / 304 评论
HN 热议 Apple Support 应用中出现 Claude.md 文件。这件事不一定造成直接安全事故,但文化信号很强:AI coding 元数据、agent 指令和项目约定正在进入构建产物的边界。未来代码审查不只看业务代码,也要看哪些模型上下文、任务说明和生成痕迹被错误打包。
Amazon、Trainium 与推理商品化:云厂商正在重新计算 AI 基础设施价值 #
Stratechery · 文章
Stratechery 从 Amazon 财报、Trainium、commodity markets 和 agent 需求出发,讨论训练到推理的重心迁移。如果 agent 调用成为常态,云厂商自研加速器的价值不只在降低训练成本,而在服务高频、低延迟、可预测的推理工作负载。今天 Codex 收入增长和 PFlash 本地优化,是同一场推理经济学的两端。
更多值得关注 #
| 来源 | 内容 | 要点 |
|---|---|---|
| GitHub | Skills for real engineers from a Claude directory · 3645 stars | Markdown skill 正在成为开发者工作流的分发格式,prompt 从句子变成可复用流程资产。 |
| 36氪 | DeepSeek 给 AI 装了根赛博手指 · 文章 | 「视觉原语」把多模态从看图答题推向可操作空间结构,适合观察中国模型工程路线。 |
| 量子位 | 国内首家百亿估值纯推理 GPU 独角兽诞生 · 文章 | 推理成本成为 AI 基础设施竞争的核心变量,国产 GPU 叙事正在从训练替代转向规模服务。 |
| V2EX | 5.5 codex 模型是不是更耗流量了 · 11 回复 | 一线用户关心的不只是模型更强,还包括 token、带宽、计费和日常使用习惯变化。 |
编辑分析 #
今天最重要的张力是:AI agent 越像真正的员工,我们越需要把管理、预算和审计重新做成软件接口。
OpenAI 说 Codex 一周内收入翻倍,Sam Altman 又把 Codex 与 Claude Code 的争论降温,这说明 agentic coding 已经过了「能不能用」的阶段。问题转向「怎样长期用」。Michaelzsguo 的 /goal 案例给出正面答案:600 字任务合约、明确 done_when、清晰非目标。Reddit 上 6000 美元 Claude 用量事故给出反面答案:没有硬预算和终止条件,长时间 agent 不是生产力,而是失控的成本中心。Taleb 的反脆弱框架在这里很实用,我们不该追求 agent 永不犯错,而要让每次错误小、早、可复盘。
三个趋势值得我们盯紧:
- AI Engineering 正在从模型调用转向运行时治理。 Codex 收入增长、/goal 长跑、Apple Support 漏出 Claude.md 都说明,团队要管理的不只是 prompt,还有任务协议、上下文边界、构建产物和审计链。读者的直接动作是给每个 agent 工作流补上预算上限、权限边界和退出条件。
- 开源 AI 的实际护城河正在变成可负担推理。 PFlash 在 RTX 3090 上优化 128K prefill、量子位报道纯推理 GPU 独角兽、Stratechery 讨论 Trainium,指向同一个判断:下一阶段竞争不是谁偶尔跑出最强答案,而是谁能把连续调用压到可承受成本。独立开发者会优先选择够用、可控、能跑在自己预算里的系统。
- 提示工程正在变成管理学,而不是文案技巧。 Andrew Ng 重开课程、宝玉强调定义问题和判断结果、Anthropic 量化 Claude 讨好风险,都说明好的 prompt 应该像任务章程:说明目标、证据、反证、权限和验收。不会写任务合约的人,会把更强模型用成更快的混乱制造器。
延伸阅读:
lz.wiki 每日精选 · 30 条来自 5 个源 · 2026年5月2日 13:00 CST RSS 订阅 · 所有精选