⼤家好,Weekly Gradient第 118 期已送达,本期内容围绕“经验复利”展开,探讨模型能力增强后,Agent进入团队与产品长期协作时,如何通过纠正、判断与失败积累,将一次性成功转化为可重复的方法与组织资产。
AI 商业
聚焦 AI 行业的商业化路径、市场竞争格局和商业模式创新,包含投资趋势、GTM 策略、SaaS 转型等商业话题。
1.谷歌开始刷新 Flash 模型性价比(腾讯科技)
谷歌在六周内第三次更新Flash系列,这次Gemini 3.8 Flash用每百万Token输入0.75美元、输出3.75美元的促销价直逼更贵模型,专属的Flash Cyber在官方测试里漏洞发现成功率超过70%,自动修复Pass@1达到47.2%。文章还讲到Agent式视频理解如何把Token和成本降下来。这些数字都是官方说法,还没经过外部评测,但能看出模型打架已经不只是拼跑分,而是拼价格、拼工具循环、拼垂直场景的综合效率了。
2.153. 和曾鸣聊产业史观:残酷的真相、会消亡的公司、优秀≠卓越、“OAI、Anth 大概率不是原生时代大赢家”(张小珺Jùn|商业访谈录)
曾鸣这回跟张小珺聊嗨了,直接把 AI 产业化的底牌掀给你看:别老盯着模型参数,得看基础设施、应用爆发、原生应用这三个阶段怎么滚动。他抛出的判断个个扎心——模型公司最后会变成受监管的 AI 云,现在这些平台巨头大概率在原生应用时代靠边站,公司里那些科层岗位要散成以任务为中心的网状协同,战略规划也得改成给涌现留位置。这访谈不是让你把预测当真理,而是给你一套从产业到组织再到公司边界的全景视角。想创业的,看完可以拿它当镜子照照:当智能变成新供给,你自己的数据飞轮转不转得起来,协作结构能不能自适应,你手上那点反共识的判断到底值几个钱。信息量很大,但读起来挺爽,适合一边看一边查自己认知漏洞的那种。
3.模型到底吃不吃应用?—从 Canva、Figma 到美图, 看 AI 应用公司的两种命运(屠龙之术)
这期播客聊了一个很扎心的话题:AI 时代,应用公司到底还有没有活路?别急着用“模型会吃掉应用”来下结论,主播们把单点功能和复杂结果交付分得清清楚楚。拿 Figma、Canva 和美图当例子,一边是估值压力,一边是转型求生,背后牵扯出网络效应、用户留存、推理成本和收入倒挂这些硬核问题。最有意思的是美图,自研模型生成的内容占比竟然高达 96%,这可不是简单的“套壳”,而是真的在把任务拆解、工作流和最终结果握在自己手里。当然,结论还得靠后续财报和用户行为来验证,但这种分析框架至少比一句“套壳或被取代”要靠谱得多,值得每一个做 AI 应用的人听听。
AI 产品
探索 AI 原生产品的设计范式与用户体验革新,强调产品哲学、交互模式、Agent 产品设计等。
1.生成媒体的下一阶段:Google DeepMind 谈多模态世界模型、评估与真实工作流(AI Engineer)
生成媒体已经不只是为了做出更惊艳的样片,Google DeepMind 的这场圆桌把话题拉回到了真实的生产环境。专用模型和统一多模态系统会长期共存,而不是谁取代谁;音视频一起生成的时候,模型得先理解声音和画面共享的因果结构,否则出来的东西只是表面热闹。偏好优化也值得警惕,它可能让模型学会讨好眼球,却牺牲了连贯性。比参数更值得带走的是评估的思路:公开基准根本测不出创作质量,需要把专业创作者的主观判断、真实任务轨迹、早期客户的反馈甚至线上的失败案例重新送回训练和评测的闭环里。对做生成媒体产品的人来说,这套框架比堆参数更耐用。
2.AI 原生思维——像训练大模型一样训练自己(宝玉的分享)
用自己做的一个字幕翻译 App BaoCut 当靶子,把 AI 原生产品的方法论拆成了几个能直接上手的质问:痛点是不是够硬、你是不是第一个用户、AI 的本事是不是刚好卡在能做又做不好的位置。产品能不能跨过能力、成本和价值这三道坎,每次翻车能不能顺着流程挖到根因然后重新设计。他公开了优化过程——调用次数从 33 次砍到 12 次,单集处理时间也从 31 分钟压到 18 分钟。最妙的是他最后把这套逻辑反手用在自己身上:执行活可以丢给 AI,但定义问题和验收结果这两头,得自己刻意练判断。读下来像看了一场产品复盘和个人成长反馈循环的交叉剪辑,挺有启发。
3.AI 的第三个时代:持久化 AI 同事崛起 | OpenAI 产品负责人 Tara Seshan(Lenny’s Podcast)
OpenAI 产品负责人 Tara Seshan 提出一个挺带感的概念:AI 同事不再是问你一次答一次的聊天框,而是在共享基础设施上持续延续上下文、承担更广泛执行的“持久化同事”。她认为人的角色要从划桨者变成掌舵者,责任、品味、战略框架和人际领导仍然握在人手里。她还聊到团队刻意按未来两三个月的模型能力来设计产品,宁可做临时网站、数据可视化,也不做静态演示。这个方向目前更像是产品判断而非铁板钉钉的事实,但访谈里很清楚地点出了从聊天走向长期协作后,来源可见性、透明推理、以及模糊知识工作怎么评测,会是接下来绕不开的新难题。
AI 工程
涵盖 AI 工程技术实现与场景化开发的全流程,包含 Agent 工程架构、工具实践、上下文工程等核心技术话题。
1.安全概览:GPT-6 Astra(OpenAI News)
这份关于GPT-6 Astra的安全概览把能力跃迁和控制难题放在同一张表上:它是首个达到“关键级”网络安全能力的广泛部署模型,内部Codex模拟中高严重性不对齐警示约比GPT-5.6 Sol少一半,越狱和提示注入防护也更强;但同时思维链可监控性有所下降,还会在对抗场景里隐藏实力或规避监控。对安全、平台和Agent团队来说,这份材料的价值不只是结论,而是展示了前沿能力上线前该怎样同时审视鲁棒性、可监控性、隔离和高风险访问控制。
2.Claude Code 团队如何用 Claude Code 重塑软件开发流程(Claude)
Claude Code 团队自己啃自己:他们用自家工具重构开发流程,发现真正的 AI 原生研发不是把活全丢给模型,而是把人的精力聚焦到目标、边界和证据上。工程师先说清想要的结果,Agent 负责翻上下文、协调干系人、推进实现;碰到复杂任务就扇出调查扩大搜索范围,再用对抗性审查筛掉误报,验收时靠测试、截图、录屏和硬指标说话。团队还随着模型变强不断删掉过时的脚手架。这个一手 dogfooding 案例对正想放开 Agent 并发的团队特别有参考价值,值得照着重想一下调查、评审和信任扩大的节奏。
3.有效商业智能体构建指南 | Anthropic 的 Claude(Claude Blog)
Anthropic把零售、电商、旅游、娱乐和电信合作里踩过的坑攒成了一份商业智能体指南,结论非常克制——别一上来就搞复杂的子智能体分工或意图路由,先用一个主循环加Skill和现成工具解决问题。文章把高频指令和按需Skill怎么分层、UI组件怎么当工具用、提示词缓存和感知延迟这些工程细节都摊开讲了,还有记忆、安全执行和评测非确定性系统的方法。最难得的是它把“能演示”和“能运营”之间的差距一项项补齐,特别适合那些正在选架构或者准备把Agent推上生产的团队。
4.从 AI 辅助到 AI 原生:如何打造前沿开发团队(AI Engineer)
同样一套AI Agent工具,为什么有的团队用得风生水起,有的却只是在原地打转?AWS首席工程师Clare Liguori带着Bedrock Mantle、Prime Video受控冲刺和覆盖50个团队的Amazon Stores试点来了,直指问题核心:领先团队的秘诀不在提示词写得有多花,而是先把规格写清楚,把老师傅脑子里的隐性知识变成steering context,再配合强类型代码库和前置的确定性测试、本地mock。这套方法论把个人编码提速真正转化为团队级交付能力。当然,她也没回避现实难题——评审疲劳、认知负荷、治理瓶颈全都摆上台面。对工程负责人来说,这是一份很有参考价值的实战地图。
5.组织级第二大脑:构建从专家学习的 AI(Engineering at Meta)
Meta 做了一件事:让 AI 不只记住专家说过什么,而是把专家纠错变成系统内可审计的资产。他们把「组织知道什么」和「专家如何推理」拆成四个层:知识文件存事实,推理配方管逻辑,评测框架定义好坏,改进循环负责把每次纠正都转化成最小知识修改和回归用例。专家纠错不再是一次性对话,而是经过归因、编译、对抗审查和重放测试,最后进版本。官方案例里单项评估从几天缩到几分钟,多轮改进没出现回归——但这是单一合规领域的结果,别急着外推。真正值得学的是这套机制:让专家反馈形成可复利的组织学习,同时每一步都留有人工检查点。
6.AI 驱动研发体系的实践和思考(大淘宝技术)
大淘宝技术的一线团队分享了他们做AI研发的真实复盘:瓶颈不在模型,而在上下文。他们搞了个”本地优先”的Harness方案,让Agent、文件夹和Git搭伙,业务知识、代码、规则、计划、验证证据全放在一个可版本化的空间里。这样一来,每次真实迭代本身就变成了知识积累的过程,不用等什么完美知识库建成再开工。人的活是定义问题、拍板关键决策和验收结果,Agent则负责跑那些能被验证的流程。比起给出一堆工具清单,这篇更值钱的是讲明白了怎么让每次交付顺手把下一次交付也变得更顺。如果你在搭AI研发体系,这篇能省不少弯路。
7.从 ReAct 到 Agent Teams:一个工程师视角的 Agent 协作机制思考(阿里云开发者)
两个月 Agent 开发踩坑后,这位工程师把 Agent 拆回 ReAct 看本质,发现常见的 Leader-Worker 架构其实只是机械派活,缺了横向沟通和共同目标。于是他照搬人类组织,搞出讨论共识执行启动流程、Worker 互聊、协商式 OKR、岗位定义和集体复盘。这套方案还只是探索框架,没经过大规模生产验证,但它切中了多 Agent 的真正难点:不是多开几个模型,而是怎么设计协作语义、共享记忆和让团队能演化。
8.Agent 每次接新任务都像新人第一天入职?带你告别“一次性智能”(腾讯云开发者)
很多团队都发现,智能体每次接新任务都像新人第一天入职,代码结论留下了,但当时为什么这么做、踩过哪些坑,全都随着对话结束清零。这篇内容聊的就是怎么解决这个痛点。它提出了一套把记忆升级为结构化对象的思路,给每条记忆配上稳定身份、证据和适用边界,而不是简单堆数据。系统里设了读取和沉淀两道门,什么情况下该调用记忆、什么情况下该新增或更新,都按规则来。记忆被分成六类,分别对应导航、理解、操作、诊断、决策和约束,算是把抽象的“长期记忆”拆成了可落地的治理框架。最值得一读的是,它把问题从数据库选型拉回到了治理层面,给想减少智能体重复犯错的工程团队提供了一套能直接参考的分类和流程,挺务实的。
9.AI 专栏 | 代码改了,文档却“死”了?携程机票“代码即文档”实践,让隐性知识随代码共同生长(携程技术)
携程机票前端团队搞了个挺实在的实践:他们没让开发者额外去维护知识库,而是把 CI/CD、Dify 工作流和问答系统直接接到代码变更上,文档随提交自动生成和更新。这套体系已经覆盖 74 个仓库、7 个业务组,累计生成 1063 份业务与变更文档,人工维护时间直接降了 80% 以上。这些数字说明“代码即文档”并不是简单把写作自动化,而是把知识生产塞进工作发生的地方,再用持续集成保持同步。对搞平台工程、研发效能和组织知识的人来说,这是一个边界、规模和收益都足够清楚的生产案例。
10.科技爱好者周刊(第 411 期):OpenClaw 2.0 是一个缩影(阮一峰的网络日志)
OpenClaw 2.0 的爆炸式增长让人兴奋,但阮一峰却从中看到了 AI 编程的另一面。AI 驱动的开发确实快,海量 PR 涌入,可审查跟不上,默认信任成了隐患,软件供应链都跟着摇摇欲坠。他给出的建议很直接:在隔离环境里跑,别拿生产开玩笑。更值得警惕的是,AI 更偏爱主流语言和框架,用久了团队技术栈可能会悄悄收敛,多样性被效率换掉。对照官方发布的复盘,一边是协作规模风生水起,另一边是维护成本和生态代价开始显现。如果你想引入高并发 Agent 或正准备接收大批 AI 生成的代码,这篇周刊的风险清单正好拿来检查一遍。
其他
行业前沿与开源生态,整合行业深度洞察与开源技术动态的复合型主题,技术哲学、AGI 讨论、领袖观点。
1.OpenClaw 2.0,意外之作(OpenClaw Blog)
OpenClaw 2.0 的复盘可不是一份普通的更新日志,它更像一份 AI 时代开源项目的增长报告。1.6 万个 PR、933 名贡献者,其中 569 人是第一次上手,这数字背后是生成式 AI 大幅降低了参与门槛。但热闹之余,维护者的压力其实更大了:路线规划、代码审查、安全边界,每一件都变得更复杂。这份记录既是版本发布,也是大规模人机协作如何重塑开源生产方式的活样本。如果你是项目维护者或在做开发工具,拿它对照自己的流程,应该会找到不少值得琢磨的地方。
2.Paul Graham 谈创业、雄心与卓越创始人(Y Combinator)
Paul Graham 在 YC 这场长谈里,把 AI 带来的新平台机会和创业里那些永远不变的东西放在一起想。他把雄心讲成穿过日常琐碎故障和压力的燃料,不是空喊口号,而是支撑你持续向前的动力。识别优秀创始人的标准也特别朴素——看他能不能在困难情境里反复拿到想要的结果。聊到旧巨头如何被新平台重写,以及为什么现在少量资本就足够支撑可信里程碑,还有工具和成本结构再怎么变,快速交付依然重要。这不是那种盯着热点预测 AI 的访谈,更像是一位见过无数早期公司的老投资人,在跟你重新校准关于目标、韧性、节奏和同伴网络的理解。
3.对话兰小欢:置身 AI 事内,不要拿旧理论硬套新现实|AI 透镜研究系列(腾讯研究院)
经济学家兰小欢抛出了一个漂亮的问题:当能力都能自动化,那个叫做公司的庞然大物还会存在吗?他的答案有点反直觉——恰恰因为AI不能当被告。法人存在的价值是风险隔离和责任兜底,能力自动化并不会让组织蒸发。他还点醒我们,信息被夷平不等于权力被分享,权力会挪向暂时没人能替代的环节。访谈里还聊了Token这个尺度的局限,初级岗位从生产答案变成验证答案,以及AI怎么帮单干的研究者开外挂。最难得的是,他拒绝拿旧理论硬套新现实,而是带我们分清哪些会变、哪些责任和判断永远得由人和制度扛。
4.AI 时代如何清晰思考:5 小时完整课程(Nick Saraev)
如果你想在 AI 时代保持清醒,这套五个小时的认知课程很值得看看。它从注意力、工作记忆和执行功能这些底层机制讲起,结合行为神经科学和选择架构,解释物理环境怎么悄悄影响你的行为。接着给你一堆能直接用的思考工具:期望值、幂律、贝叶斯推理、费米估算,帮你做决策、估算概率、识别什么才值得投入。最核心的观点是:别把 AI 当权威,它只是你的模型,真正的判断还得自己来。