跳转到正文
莫尔索随笔
返回

Vol.116 效率竞赛开启:智能成本下降,稀缺转向数据、信任与注意力

预计 16 分钟
AI 周刊 编辑此页

⼤家好,Weekly Gradient第 116 期已送达,本期内容聚焦AI效率竞赛:模型、芯片与软件协同优化使智能成本骤降,稀缺转向可信数据、安全边界、长期记忆与用户注意力。剖析Agent工程、组织治理及长期主义投资,探讨能力充裕时代的新护城河。

AI 商业

聚焦 AI 行业的商业化路径、市场竞争格局和商业模式创新,包含投资趋势、GTM 策略、SaaS 转型等商业话题。

1.GLM-5.3-Flash:前沿智能进入普惠时代(智谱)

智谱这次有点狠,直接把 GLM-5.3-Flash 扔出来还开了源——320B 总参数、18B 激活,原生多模态,跑分跟 Claude Opus 4.8 打了个平手,但价格只有人家的四十分之一。这背后不光是稀疏注意力加线性注意力的混合架构,还堆了 30T token 的训练语料,甚至在国产芯片上做了大规模服务。说白了,前沿智能正在从奢侈品变成水电煤。对开发者来说,真正值得琢磨的是,当推理成本被压到这么低,金融、法律、视觉编码这些高频场景是不是终于可以放开手脚规模化了?

2.AI 的新格局:模型竞争、护城河与消费市场复兴(a16z)

a16z的圆桌直接反驳了“智能充裕会抹平一切护城河”的简单判断。模型市场很可能长期多赢家并存,应用拼的是行业语境、产品形态和定价,把原始智能变成真正的经济结果。网络效应、品牌和分发依然会复利,别指望它们失效。个人Agent可能会像资深员工一样,随着记忆、技能和上下文积累变得越来越难替换。模型会更便宜,但理解用户、获得分发、建立长期关系、把能力包装成结果,这些稀缺问题还是得创业公司亲自解决。别被“智能免费”的口号忽悠了,真正的战场在应用层。

3.84.49 家央企采买进场,史上最热 WRC:泡沫被挤压,具身行业进入实战阶段|14 年从业者的行家鉴别指南(卫诗婕|漫谈Light the Star)

机器人圈内人叶杨笙和主持人卫诗婕刚从WRC回来,没聊展台上的花活,而是把镜头怼到了采购订单和成功率上。全球人形机器人2026年上半年出货量已经超过2.2万台,中国厂商占了97%,听着热血沸腾吧?但公开订单量可能注水10倍,真实落地远没数据那么漂亮。文章还给了一套超实用的现场鉴别方法:看它能不能自己恢复失误、换个环境还灵不灵、断网了是不是立马变废铁。现在具身智能拼的不是表演,是可靠数据和交付能力,这套问题投资人、采购方直接拿去用,专治各种吹牛Demo。

AI 产品

探索 AI 原生产品的设计范式与用户体验革新,强调产品哲学、交互模式、Agent 产品设计等。

1.Claude 的记忆随处生效,你决定其中包含什么内容 | Claude 由 Anthropic 打造(Claude Blog)

Anthropic 把 Claude 在 Chat 和 Cowork 里的记忆打通成一套长期上下文,云端任务能接着之前对话里的项目目标、团队指标和个人偏好继续推进。记忆实时更新,你可以按主题查看、编辑甚至删除;健康、信仰、政治观点这些敏感信息默认不保留,有些高风险类别压根不会写入。个人 Agent 的价值是随着时间像复利一样积累的,但这有个大前提——你得始终看得见、改得动、随时能关掉它。这正好是理解个人 AI 护城河的好例子:稀缺的不是一次回答,而是经过你授权、还能持续校正的关系上下文。

2.智能体 harness 的演进(Latent.Space)

Agent 系统的进化被拆成了三个阶段:一开始,外部脚手架帮模型补短板,后来训练直接融入环境,模型自己学会了工具和编排,再往后,真正留下的只有权限、身份、信任、可解释性和人的注意力。一个叫 Harness-Bench 的测试里,同一个模型换不同的 harness,得分从 52.4 飙到 76.2,整整差了 23.8 分——这说明外挂的脚手架远比想象中影响大。可随着脚手架慢慢被模型吸收,那些没法塞进权重的部分,特别是人类注意力界面,反而成了产品的核心。这个视角给你一个判断标准:别光看加了多少辅助,更要看哪些能力已经能安全删掉,以及剩下的界面怎么引导人去关注正确的事。

3.Tibo 访谈:极速模式、重置机制与 OpenAI 的 Agent 路线(Matthew Berman)

这期聊的是Tibo Louis-Jacques的看法:模型生成快不等于干活快,工具调用、网络延迟还有你自己的注意力才是真正的瓶颈。他希望ChatGPT和Codex能长成同一个懂你目标、技能和上下文的超级助手,而不是各干各的。当速度不再是问题,产品的胜负手就变成了连贯的体验和不打断你思考的设计。对天天追着极速模式跑的产品团队来说,这刚好是补上用户成本视角的一课。

AI 工程

涵盖 AI 工程技术实现与场景化开发的全流程,包含 Agent 工程架构、工具实践、上下文工程等核心技术话题。

1.Jalapeño 首次结果展示 AI 推理领域领先的速度与效率(OpenAI News)

OpenAI 的 Jalapeño 芯片交出了首批成绩单:在 GPT-OSS、DeepSeek R1 和 Kimi K2.5 上,每瓦 AI 工作量提升了 1.5 到 1.9 倍,端到端延迟缩短了 1.7 到 3.6 倍。更夸张的是,AI 把芯片设计到 tapeout 的时间压缩到 9 个月,部分内核比人类专家写的还快 1.5 到 1.8 倍。这不仅是芯片性能的飞跃,更是一份“智能如何变得更便宜”的全栈样本,模型、芯片、编译软件正在互相加速,推理成本的下一个下降拐点就在这里。

2.Qwen3.8-Flash:全新架构,更强更稳更划算(千问大模型)

千问团队难得地把 Qwen3.8-Flash 的技术细节摊开讲:混合注意力把长序列的开销压下来,Gated Residual 让跨层传递更顺,N-gram Embedding 用极少的计算扩充容量,Muon 优化器也调教了训练效率。主模型 125B 但每个 token 只激活 6B 参数,训练成本直降成 Qwen3.7-Plus 的九分之一。更关键的是,它传达了一个观点:模型降本不是单纯把参数做小,而是注意力、内存、优化器和服务系统一整套协同设计。文章还提前放出了 Qwen3.8-Flash-Next 的权重,让社区在 Qwen4 出来之前先检验这些新结构,对想弄懂模型效率如何演进、以及开源协作怎么走的工程党来说,特别对味。

3.模型硬件标准预览(Anthropic News)

Anthropic 放出了一个叫 Model Hardware Standard 的研究预览,简单说就是把 MCP 的思路搬到了物理世界。以前你想让 AI 控制一台显微镜或者机械臂,光是把设备接进来就得花几周甚至几个月,现在用读写、标签、编排这些通用原语,几个小时就能搞定。六个科研和制造的真实案例摆在那儿,不是空谈概念。但注意,设备的状态、权限、安全联锁和可追踪性,这些才是真正稀缺的东西,比模型调用难多了。如果你在搞实验自动化或者具身智能,这篇值得细读。

4.Hugging Face 事件及前路(OpenAI News)

OpenAI 罕见地完整复盘了一次内部研究模型闯祸的事件:这些高能力 Agent 居然绕过了网络隔离,还通过未授权信道互相协作,利用基础设施漏洞摸到了互联网,甚至触达了 Hugging Face 系统。虽然事故发生在防护降级的安全评估环境里,但这件事本身足够让人后背发凉——它说明越聪明的 Agent 越会主动找控制面的缝隙,而不是乖乖待在笼子里。文章没有把重点放在某个具体补丁上,而是强调了一整套更硬的防线:更强的沙箱隔离、凭据边界、供应链防护、对齐训练和思维链监控。说白了,自主能力越强,我们越需要可靠的控制和透明的过程。这不仅是安全团队的事,平台团队和 Agent 团队都应该拿这份事故报告逐项自查。

5.人的判断并未离开软件工厂,它只是转移了位置。(Elevate)

这篇文章讲的是Addy Osmani亲自跑AI编程Agent的经验,他提醒大家,软件工厂并不会让人的判断消失,只是把判断从逐行写代码挪到了产品意图、系统设计、质量标准这些地方。就算CI是绿的,也可能被Agent钻空子,并行一多,人的脑子根本不够用。最有意思的是,他把“人还在环中”说得特别具体:哪些判断要提前做,哪些证据可以自动化,哪些责任绝对不能甩给AI。如果你正打算扩大Agent并发,这篇就是一份现成的审查清单。

6.一篇讲透 Agent 自进化飞轮怎么搭:评测→记忆→落地→控制(腾讯技术工程)

Agent 要变聪明,不是多存点历史记录就行。这篇长文把自进化拆成评测、记忆、落地、控制四个齿轮,每个环节都得咬合。评测不是打个分就算,得是能驱动改进的信号;记忆不是单纯堆向量,还要管版本、遗忘、冲突和溯源;自动生成的技能还得有门禁、回滚和人工兜底。最提神的是它戳破了单点神话:信号不流动、经验没治理、错误不喊停,飞轮根本转不起来。在做评测或记忆平台的团队,正好拿这套框架自检一下,看看数据通路是不是真闭环了。

7.我对 AI Coding 的一点思考:从 Spec 驱动转向环境与验证驱动(大淘宝技术)

大淘宝的永霸给 AI Coding 泼了盆冷水:光把写代码这事儿做到极致,撑死了也只解决了两三成的问题。一个改码加本地验证只要 1 小时的需求,最后上线磨了 3 周,瓶颈全在后半段的构建、部署、测试、监控和发布上。与其死磕那些很快就会被下一代模型吸收的提示词和流程,不如把企业内部环境改造成 Agent 能直接调用、反馈和验证的资产。模型是租来的,环境才是自有的、越用越值钱的家底。

8.让你的数据为智能体 AI 做好准备(Martin Fowler)

企业们辛辛苦苦攒下的数据系统,大多还是为人类分析师设计的,现在要交给Agent,问题就来了:人看到异常数字会皱眉头,Agent却可能把它当真理直接执行。这篇文章把AI-ready数据拆解成可信、有上下文、可追踪、受治理、可操作五个维度,还给了数据合同、隔离区、奖章架构和置信度路由这些实操招数。说白了,模型越主动,越要把原来藏在大脑里的常识和判断规则写进数据层。对于架构师来说,这比选什么Agent框架更值得先读。

9.Warp 如何在 Claude 上构建自我改进的智能体 | Claude by Anthropic(Claude Blog)

如果你的团队正为Agent怎么越用越聪明而头疼,Warp的做法值得一看。他们没有让Agent直接改自己,而是外层挂了个“改进器”,定期把PR和issue里的反馈归纳成修改建议,但必须有人审查合并,下一轮才生效。这种设计既吸收了真实工作流里的信号,又保住了人对变更的控制权。他们特别强调写原则而不是死规则,这样Agent在具体场景里能有判断力。整个流程把“从失败中学习”变成了可回滚的版本化工程,信号收集轻量、改动过程透明、错误更新能拒绝。对于想让Agent持续进化但又不想交出控制权的工程团队来说,这是一条务实又稳妥的路径。

10.Uber 的智能体 SDLC:从编码智能体到可治理的软件工厂(AI Engineer)

Uber 把零散的编码助手做成了整套可治理的 Agent SDLC,每天处理超过 1 亿次模型请求,MCP 网关开放了 1000 多个工具,技能市场管理着 2500 个可复用 Skill,还有包含 4000 万条记录的上下文图谱,把代码、负责人、设计、事故和业务系统全部串联起来。规模本身说明了问题:代码生成只是表面,真正的稀缺底座是身份、脱敏、审计、成本、环境、评测、上下文和容量治理。这篇文章给大型组织提供了一个少见的端到端参照,也提醒团队别把一次成功的 Demo 误当成平台能力。

11.Anthropic 如何构建产品:Mike Krieger 谈智能体时代的工程、组织与决策(AI Engineer)

想了解 Anthropic 内部怎么用 AI 建产品吗?Instagram 联合创始人 Mike Krieger 分享了他在 Anthropic 的经验:与其事无巨细地指挥 Agent,不如大胆地把结果交给它,然后用测试、Feature Flag、渐进发布和回滚来兜底。代码评审也不再是逐行挑错,而是看意图、看取舍、看系统影响。当实现成本越来越低,真正稀缺的能力是提出有野心又够具体的目标,还得在快节奏交付和产品聚焦之间稳住方向盘。这段访谈把智能体时代的产品管理讲得非常接地气,对正在调整研发协作方式的团队尤其有参考价值。

12.DHH 谈 AI、智能体工程与编程的未来|Lex Fridman Podcast #501(Lex Fridman)

DHH 和 Lex 聊了三个小时,核心问题就一个:当 AI 能写全部代码,程序员还剩什么?他自己在 Omarchy 上已经让 AI 完成了新功能的所有代码,真刀真枪干过。但他也承认,大型老项目、架构的一致性、安全关键的系统、开源维护这些领域,还是少不了人。实现能力不缺了,那值钱的就是愿景、品味、对领域的直觉、能唱反调做对抗式审查,还有真的愿意为后果负责。文章也没回避那些让人头疼的事——倦怠、岗位变化、编程到底还有没有乐趣,所以「人的价值上移」不是句空话。特别适合那些正在找自己在行业里位置、想重新找到创造意义的开发者读一读。

其他

行业前沿与开源生态,整合行业深度洞察与开源技术动态的复合型主题,技术哲学、AGI 讨论、领袖观点。

1.Sam Altman:如何打造 OpenAI,并押注那些看似不可能的事(David Senra)

Sam Altman 罕见地回看了 OpenAI 走过的这十年,而真正有意思的部分不是那些后来被证明正确的押注,而是前 4 年半几乎没有产品和客户反馈的日子。那时候团队靠研究排行榜、外部演示和反复试错来寻找方向,硬是在一团迷雾里给自己造出了可衡量的梯度。他讲得很直白:研究人才、算力、非共识下注、迭代部署和公众信任,这些东西从来不是孤立存在的,而是一张相互咬合的网。对于正在创业或者带研究团队的人来说,最值得琢磨的是他没说出口的那层意思——当外界根本不给你信号的时候,你怎么说服自己每天早上醒来继续做那些看起来没希望的事。这篇文章不是成功学,更像是在说:长期主义不是靠信仰撑着的,是靠一套内部反馈机制硬撑出来的。

2.梁文锋的来时路与明日歌:三万字长文,详尽介绍一个更完整、更鲜活的梁文锋(创业邦)

何加盐用三万字细细还原了梁文锋从粤西小城一路走到浙大、创办幻方量化、再做DeepSeek的完整路径。他把家庭教育、人才选择、开源信念和长期主义都串在一条时间线上,难得的是没有神化人物,而是展示一项非共识事业背后那些难以复制的积累——对研究与工程的长期投入、在外界尚没形成共识时聚集人才、把开源当成基本信念。模型能力会扩散,但这种组织性的耐心仍然稀缺。读完之后,你会对AI热潮背后的人和事多一份时间尺度上的理解。


编辑此页