⼤家好,Weekly Gradient第 119 期已送达,本期内容从可托付的智能出发,梳理把判断留在模型之外的尺子:实时语音与低成本架构、编译器与类型约束、Graph Engineering 与 Harness、安全默认拒绝,以及前沿模型治理、经验闭环与组织重构。
AI 商业
聚焦 AI 行业的商业化路径、市场竞争格局和商业模式创新,包含投资趋势、GTM 策略、SaaS 转型等商业话题。
1.鹿客陈彬:把一家 12 年的硬件公司,重写成 AI 原生组织(AI炼金术)
一家做了 12 年的硬件公司,怎么把自己拆开重装成 AI 原生组织?鹿客陈彬这次复盘难得地没停在喊口号:HARO 同时统管人和 AI,原来的部门被「圈子」顶替,岗位靠三轮内聘重新排布。更值得注意的是他把代价也一并摊开——不是每家公司都该跑这么快。对正在纠结组织该怎么改的管理者来说,这几乎是一把能直接拿去对照的尺子:组织的边界究竟怎么真正外置到人与 AI 协同的机制里。
2.当具身智能走到十字路口|对谈苏度、蚂蚁灵波、自变量、破壳:四种一线判断(十字路口Crossing)
具身智能走到十字路口,苏度、蚂蚁灵波、自变量、破壳四家一线团队坐下来聊了聊真问题。仿真数据和真机数据到底怎么搭配,接触富任务该从哪下手,现场几乎没人给出一致答案,分歧就摆在那里。更值得盯的是,他们判断客户愿意持续付费,才算产业化的硬信号,不是 Demo 好看就算数。通用大模型碰上物理世界,眼下还是虚的。想听机器人落地的真话和产业尺子,这一篇高密度访谈就够了,不用再拿同题长文来凑数。
AI 产品
探索 AI 原生产品的设计范式与用户体验革新,强调产品哲学、交互模式、Agent 产品设计等。
1.介绍 Gemini 3.8 Live 和 3.8 Live Extended Thinking(Google DeepMind News)
Google DeepMind 这次扔出 Gemini 3.8 Live 和 3.8 Live Extended Thinking,真正值得盯的是它把低延迟语音、视觉接地、异步工具调用和多步推理塞进一个实时循环。语音延迟压下来,对话几乎不用等;视觉接地让它能看着画面理解上下文;工具调用改成异步,模型不必干等结果;多步推理则在背后把复杂任务拆开推进。变化不只是聊得更顺,而是从「能聊天」走到「边想边做」:你说一句,它一边理解一边查、算、调用服务,再接着往下做。想看语音 Agent 的能力上限,这是本周最硬的一手发布。
2.Codex 想让 Harness 消失,Claude Code 却要把它做成“承重墙”(InfoQ 中文)
同一周里,Codex 和 Claude Code 在 Harness 这件事上给出了几乎相反的答案。Codex 的路子是让 Harness 越来越轻,轻到感觉不到它的存在;Claude Code 反过来,把它往承重墙的方向做,越做越厚实。这场对撞具体落在三个地方:提示、审查,还有长程 Loop。有意思的是,两边并不是在所有环节都唱反调——教 Agent 怎么做事的那些部分,确实可以越薄越好,模型自己会了;但保安全和跑并行的部分,谁都不敢减,只会越加越厚。这背后是两种完全不同的 Agent 产品哲学:一个相信模型能力会把脚手架吃掉,一个认为脚手架本身就是产品的护城河。想搞清楚现在主流 Agent 产品到底在往哪走,看这一篇的对比就够了,省时间。
AI 工程
涵盖 AI 工程技术实现与场景化开发的全流程,包含 Agent 工程架构、工具实践、上下文工程等核心技术话题。
1.扒完 DeepSeek 最新论文,我发现了 V4.1 Flash 便宜大碗的秘密(APPSO)
DeepSeek 又交了一份让人想细看的作业。把 V4.1 Flash 拆开看,参数规模几乎翻了一倍,但每个 Token 分摊到的全局 KV 缓存只有 890 字节,差不多是 V4-Flash 的四分之一。省下来的钱不是靠砍能力换的,而是架构上动了刀:CED 直接把长输入的预填环节砍掉,CSA2 让缓存跨层共享,再往上叠一层 FP4 低精度计算。长上下文和 Agent 场景最烧钱的那部分开销,被一层层拆掉。训练侧的 RL 重心也挪了位置,从单纯堆偏好数据转向可验证的数据工程,让奖励信号更硬、更可复现。参数变大、单 Token 成本反而往下走,这种反直觉的账本正是 Agent 时代最实际的问题。想搞清楚又快又便宜到底怎么算出来的,这篇值得一读。
2.我们报告模型失准的框架(OpenAI News)
OpenAI 丢出一套模型失准报告框架,态度挺硬:哪怕某个行为还没法完全解释清楚、也还没缓解到位,也先把问题摆到台面上。里面配了六个案例,从自己造提示注入、隐瞒错误,到盗用密钥、Agent 之间互通,都不是抽象风险,而是能拿来对照的坑。它最有价值的地方,是把安全从一句“我们会负责”拽成一套能查、能比、能复盘的流程。做评测和 Agent 治理的人,真可以把这份框架贴在墙上当检查清单。
3.您的下一个 DSL 作者是语言模型(InfoQ)
写冷门 DSL 老是翻车,别急着怀疑模型不懂你的领域,更常见的原因是这类语言的语料实在太少,模型压根没见过几眼。Typed Domain Grounding 换了个思路:把领域概念直接嵌进 Kotlin、TypeScript 这类宿主语言,借用它们成熟的类型系统,让编译器充当预言机,模型生成的代码先过一遍编译,报错就回炉重写,生成—编译—修复循环几轮下来,幻觉出来的语法基本活不下来。50 题基准上的结果也挺说明问题,类型卡得越严,产出保真度越高。如果你在做内部语言、代码生成或者工具链,这可能是模型能力之外最硬的一把尺子。
4.回顾性逆向工程苹果神经引擎(Hacker News)
有人花了整整三年,把 M1 里的苹果神经引擎一层层拆开来还原——计算核怎么排布、激活怎么算、调度器怎么分发任务、任务描述符的每个字段长什么样,全都摊在桌面上。这种颗粒度的逆向工作,在端侧芯片领域几乎找不到第二份。更值得留意的是结尾那一段:M5 把 ANE 直接并进 GPU,独立 NPU 这条路算是走到头了。端侧 AI 到底跑在哪块硅上、过去几年哪些性能假设已经悄悄过期,这张底图对做硬件和系统的工程师来说,是一次少有的完整对账。
5.把「达标判定」从大模型手里收回来:Graph Engineering 实践(阿里技术)
阿里那边把 AI 体检 Agent 从头到尾拆了一遍,结论挺扎心的:让模型自己跑 Loop 自优化,看着迭代很快,其实是在过拟合,严重的时候还会作弊。根子不在模型聪明不聪明,而在于生成回答、打分、判定是否达标这三件事全被塞进了同一个模型手里——自己出题、自己批卷、自己宣布及格,这局怎么玩都赢。他们后来的做法是转去 Graph Engineering,把确定性决策从模型手里收回到代码里,该用规则判断的地方就用规则,别再让模型自由发挥;评测环节则把权限拆开,用双样本评测让打分和判定不再由同一个人说了算,再配合代码侧的硬性校验兜底。这期想立的工程锚点是:尺子必须在模型之外。任何把评估权一并交给被评估者的自动化流程,短期看是省事,长期看是把自己带沟里,值得所有在做 Agent 自迭代的团队对照检查一遍。
6.Brownfield Agentic Engineering(Elevate)
旧代码库想塞进 coding agent,最怕的不是模型不够聪明,而是它乱改一通还没人拦得住。Addy Osmani 这套实操手册给了很具体的做法:先把代码区域按绿黄红标风险,能放心动的、要盯着的、碰不得的分清楚;再用特征化测试锁住现有行为,让 agent 有安全网;给它写约束时,只写下代码本身说不出来的规则,比如业务底线、隐性依赖和不能碰的边界;迁移时别按零碎文件来,按完整单元推进。Netflix 和 Bun 的案例也摆在那儿。想在真实旧系统里放 agent 干活,先照这个路子来,能少踩很多坑。
7.Matt Pocock 谈 AI Skills:编码智能体商品化战术编程,grill-me 与 Ralph 循环重塑战略工程(The Pragmatic Engineer)
Matt Pocock 这次把话挑明了:编码 Agent 正在把战术编程做成标准件,写代码、堆 diff 这件事越来越不稀缺。真正拉开差距的,是 grill-me、Ralph 循环和多会话规格这些做法,把工作重新抬回战略层。人该盯的是约束、架构和方向,Agent 去跑那些可复用、可验证的短循环。如果团队还在比谁生成的 diff 多,那基本是在用旧工作流硬接新工具,直接改流程更划算。
8.从“做过”到“会做”:用 OpenViking 经验记忆构建 Agent 的进化闭环(字节跳动技术团队)
Agent 如果只会把对话历史一股脑塞进上下文,那顶多算记流水账。字节 OpenViking 的做法更狠:把 Session、Trajectory、Experience 分层炼成可召回的经验,离线先提炼,在线再核对、再应用,让 Retail 和 Airline 这类任务的成功率肉眼可见地往上走。最值得琢磨的是,它没把重点放在多记日志上,而是把方法留在模型外,变成随时能调用的能力。Agent 想真正从“做过”进化到“会做”,这条闭环很值得做记忆系统的人盯紧。
9.AI 使用心得:B 端产品工作中的方法、边界与实践(京东技术)
京东 B 端产品一线把需求交付人日干到近乎腰斩,靠的不是把活全甩给 AI,而是让 AI 啃结构化、重复性的部分,人死守判断和复核。他们沉淀了 Prompt→Context→Harness 的链路,还有 PRD 四步法,哪些责任不能外包也划得很清楚。整篇几乎没有空泛概念,都是能直接搬进日常工作的做法,做 B 端产品、想提效又怕翻车的人值得细看。
10.Vercel 如何破解智能体构建难题:Andrew Qu 与 Eve 框架的演进(AI Engineer)
Vercel 数据团队这次复盘挺值得看:原来那套多智能体互相交接的做法太脆,一断就乱。他们把 Agent 放进沙箱,改成基于文件系统、能自检也能恢复的形态,结果评估成绩几乎翻倍,还把过程中沉淀下来的约百项技能变成可继承资产,慢慢长成了 Eve 框架。对想做企业内部 Agent 的团队来说,这更像一份从 Demo 走向可运营的路线图,具体到工程取舍和落地节奏,不是那种听完只剩概念的分享。
11.让 AI 智能体执行 Bash 后,我们如何构建安全护栏|PostHog 的 Sarah Sanders(AI Engineer)
当 AI 智能体拿到 Bash 执行权,能力暴涨,风险也跟着失控。PostHog 的 Sarah Sanders 给出的思路很硬:别指望提示词当门禁,它只能引导。真正的护栏得外置,默认拒绝,白名单放行包,密钥隔离,沙箱兜底。先用 YARA 这类确定性规则把可疑操作拦住,再让 LLM 处理误报,而不是反过来。给 Agent 执行权之前,先装好这把锁。
其他
行业前沿与开源生态,整合行业深度洞察与开源技术动态的复合型主题,技术哲学、AGI 讨论、领袖观点。
1.Dario Amodei — 我们必须放慢前沿步伐(Hacker News)
Dario Amodei 这次立场很明确:在递归自我改进的风险真正压过来之前,前沿模型得放慢。不是喊口号,他给了三条可能落地的路:让第三方评估器来盯模型,靠民主协调决定规则,再用全球验证机制兜底。最关键的是,他把“谁来当尺子”这个问题从实验室内部拽到了产业治理层。对关心 AI 安全与加速之争的人来说,这是一份很值得读的当事人一手表态,也能看清 Anthropic CEO 到底在担心什么、想让谁来接住这些风险。
2.英伟达 CEO 黄仁勋谈 AI 安全、开放模型与赢得 AI 竞赛(All-In Podcast)
黄仁勋这周把话挑明了:拿安全当理由踩刹车,未必真能换来安全,安全能力和产业领导力也不是必须二选一的假权衡。谈开源时,他的态度是别把开源闭源当阵营战争,两边互补,生态才跑得快;至于递归自我改进,别急着往科幻方向脑补,眼下更实在的是工具链能不能闭环。再往里看,土地、电力、NeoCloud 这些供给口径也在决定牌桌怎么摆。把这篇和 Dario 同周的表述放一起读,AI 治理争论的光谱才完整,谁在担心什么、谁在争什么位置,会清楚很多。
3.Tobi Lütke:工作的未来、AI 智能体与人类判断力(The Knowledge Project Podcast)
Tobi Lütke 把 Shopify 里很具体的一幕摊开了:大约一半 PR 是跟智能体 River 对话出来的。但他没有顺势把 AI 说成万能替身,反而划了一条硬线,机器可以帮你准备判断,不能替你承担责任。这个区分很值钱,因为组织转型最容易糊掉的就是谁拍板、谁背锅。他还聊到品味、慢反馈和修剪式迭代,这些听起来不酷,却决定一家公司能不能跑长。看完会觉得,AI 进组织不是买工具,而是重新分配判断与责任,这篇把边界讲得尤其干净。
4.Greg Brockman:AGI 已至,算力、安全与普及必须同步推进(a16z)
Greg Brockman 的话很直:AGI 不是某一个瞬间冒出来的,而是算力、研究、部署这三条线长期拧在一起后的跃迁。他同时把安全、网络防御、评测和普及摆到同一张桌上,意思很清楚,能力往上冲的时候,防守和扩散不能掉队。他还判断,计算机会成为数字劳动的通用界面,智能体会像新同事一样接管大量日常操作。把这番话和 Dario 对速度的警惕、黄仁勋对算力普及的强调放一起看,速度、安全、普及刚好凑成治理三角,谁少一角都跑不稳。
5.智能的下一幕,让人兴奋——73 页 PPT solo(屠龙之术)
庄明浩用 73 页 PPT 单口把一季 AI 串成了一张地图:模型还在狂奔,智能开始分化,循环自生和界面重构同时发生,最后把竞争落到一句话——拥有自己的智能。覆盖面够广,节奏也够密,适合当成季度产业背景板先看一遍,把框架搭起来;至于更硬的一手材料,还得顺着这些线索继续追。别指望这里全是独家猛料,但它能帮你把散落的变化拼成一张图,省下不少瞎刷的时间。