跳转到正文
莫尔索随笔
返回

Vol.120 第115期AI精选:个人智能体产品潮,贴身智能与人的判断位置

预计 17 分钟
AI 周刊 编辑此页

⼤家好,Weekly Gradient第 120 期已送达,本期内容聚焦个人智能体的产品发布潮,从贴身处事、模型降价与语音接口,到评审问责与人的判断位置,回答智能体如何进入生活、人退到哪里。

AI 商业

聚焦 AI 行业的商业化路径、市场竞争格局和商业模式创新,包含投资趋势、GTM 策略、SaaS 转型等商业话题。

1.什么样的 AI 助手值得付费?消费级智能体的价值、信任与成本(a16z)

a16z 跟 Assistant Bench 的作者坐下来聊,拿 122 款消费级智能体做基准研究,又实测了 26 款,核心问题很直接:什么样的 AI 助手真值得你掏钱。答案不是帮你省几分钟,而是能主动去追回款项、处理报销、比价这种麻烦事。一次有害操作就足够把信任打穿,所以主动服务和垂直领域的专有知识才是真壁垒。另一个冷冰冰的现实是,每天大约 20 美元的运营成本,可能就是长尾创业者能不能活下去的生死线。想研究 AI 产品形态和商业模式的人,这期对谈值得细看。

AI 产品

探索 AI 原生产品的设计范式与用户体验革新,强调产品哲学、交互模式、Agent 产品设计等。

1.GPT-6.1 Sol 正式发布(OpenAI News)

OpenAI 又发新模型了,这次间隔只有七天——GPT-6 Sol 刚落地,GPT-6.1 Sol 就跟着来了。最让人坐不住的是价格:输入每百万 token 2 美元,输出 10 美元,缓存输入甚至压到 0.10 美元,差不多只有 Astra 的五分之一。便宜归便宜,能力并没有明显缩水,在智能体编码、电脑操作和专业工作任务上,它的表现已经相当贴近 Astra。DeepSWE v1.1 上,它跟 Astra 打平;GDP.pdf 这类专业文档任务里,它的成本不到带回退的 Opus 5.5 的一半,成绩反而更好。这件事的意义不只是又多了个便宜模型,而是前沿能力开始按日用价卖。对想让个人智能体全天候待命的开发者来说,这才是算得过账的前提。如果你正在做模型选型,或者要给智能体项目排成本预算,这一版值得认真放进对比清单。

2.Eleven v4:我们最具表现力的文本转语音 AI 模型(ElevenLabs Blog)

ElevenLabs 发布最具表现力的文本转语音模型 Eleven v4:在 Artificial Analysis 排名第一,盲测对比中获得约 75% 听众偏好,能理解语气、节奏、情绪与上下文,多说话者交互更自然;配套 v4 Turbo 中位推理延迟约 100 毫秒,比两个人对话间的停顿还快,专为实时智能体语音而生。当个人智能体常驻身边,语音是它开口的第一界面。适合关注语音与多模态产品的读者。

3.帮大家总结了一下凌晨的 OpenAI 2026 开发者大会。(数字生命卡兹克)

卡兹克通宵蹲完 OpenAI DevDay 2026 的中文全景整理:个人智能体 Dots 向 Pro、Business、Enterprise 用户推出,每个 Dot 有自己的云电脑与执行环境,可联动 ChatGPT 生态超过 4000 个应用,并预告短信与电话入口;ChatGPT Space 把「Human + Agent Native」的工作空间变成现实。另有扫描过 3000 多万 commit 的 Codex Security Cloud 靠定时扫描变成常驻安全智能体,以及订阅随身带、Figma 与 Adobe 整页嵌入等生态更新。大厂集体押注个人智能体的一周,这是最完整的中文整理。

4.Claude Code 的下一个时代——Thariq Shihipar,Anthropic(Latent.Space)

Anthropic 里最擅长把事讲明白的人之一 Thariq Shihipar,这次坐到了 Latent.Space 的对面。他先把半年的发布线一口气捋直:从 Claude Tag 到 Opus 5.5,一路数到当天刚发布的 Sonnet 5.5,哪一步接在哪一步后面、节奏为什么这么排,听完基本不用再自己翻时间线拼图。更值得琢磨的是后半段他指向的方向。Claude Mods 抛出了「可变软件」这个说法,意思是工具不再是钉死的成品,你能像改代码一样随手改造它,社区已经玩出了 Claude 里的俄罗斯方块——这种把改造权交回用户手里的做法,才是它跟以往插件体系真正的分水岭。Claude Projects 走的则是另一条路,干脆让会话管理这件事消失,想法随到随发,不用先纠结存在哪、怎么切。这篇访谈配上官方 mods 发布文一起看,是理解 Claude Code 生态「下一个时代」最省力的一份地图,也能看出一家模型公司是怎么把产品哲学落成具体交互的。

5.DeepSeek Harness 桌面端:现在,开箱即用。(DeepSeek Harness 团队)

DeepSeek Harness v0.2 预览版发布,macOS 与 Windows 桌面端开箱即用:日常办公与开发能力内置,插件输入 npm 包名即可安装,自动化任务可在界面里设定与查看。官方口径下它已是 DeepSeek API 用户中最受欢迎的 coding agent,约 60% 用户在用第三方插件;路线图还排着沙箱、智能体团队与长期记忆。开源、可组合、装在本地,是个人智能体工作台浪潮里门槛最低的一档。

6.Manus 回来了!更新 2.0 并发布全天候智能体 Cue(机器之心)

Manus 这次回来得挺有底气,直接跳到 2.0,还带上了自研的 Agent Harness Cascade。内部测试的数字是 token 消耗降 23.2%、任务完成时间缩短 28.2%、运行成本降 32%,三项一起往下走,说明不是靠堆算力换效果,而是把执行链路重新捋了一遍。配套的 Cloud Computer 给每个项目分一块全天候独立云端运行环境,Automations 也不再只是定时任务那一套,邮件、日历、Slack 上的动静都能触发工作流。更值得聊的是同期放出的独立应用 Cue,每个智能体都有自己的邮箱、电话号码、钱包和电脑,能组队分工干活,也能扫码点餐、替人排队。说白了,这是第一次有人把个人智能体的身份证和住址一次性配齐,让它们从工具变成有身份、能常驻的角色。这一步走通,比拼的就不再是谁的模型更强,而是谁能先让智能体真正住进你的日常。

7.Google Search 产品负责人 Robby Stein:AI 时代如何成为优秀的产品经理(Lenny’s Podcast)

Google Search 产品负责人 Robby Stein 给 AI 时代的产品经理提了个醒:执行正在变得便宜,真正稀缺的是判断力。怎么判断?把用户做选择时的场景还原出来,别只盯着功能,去找他们真正要完成的任务;遇到根因也别指望一次性拍脑袋解决,靠迭代把它磨掉。Stories 和 Reels 的演进就是活例子,产品形态不是一上来就定死的,而是在用户反馈和约束里长出来的。放到 Google 的 AI 体验上也是同一套逻辑:模型能力越强,PM 越要决定什么值得做、为谁做、做到什么程度。正在重新定位自己角色的产品人,这段值得细看。

8.Atlassian CPO Tamar Yehoshua:AI 如何拓展产品团队的角色,以及何时亲自上手、何时掌舵(Lenny’s Podcast)

Atlassian 的首席产品官 Tamar Yehoshua 抛出了一个挺扎心的观察:AI 正在把产品团队的分工彻底搅乱。她讲的例子很具体——一个 PM 一个月提交了 26 个 PR,团队整体吞吐量翻了 3 倍,10 周里交付了 22 项功能。这些数字放在以前,产品经理基本不可能沾代码,现在却成了日常。更有意思的是她给的那套判断框架:别纠结要不要亲自写代码,先看瓶颈在哪儿。如果瓶颈卡在自己手上,那就下场动手把阻塞解开;如果瓶颈在方向和优先级,那就老老实实掌舵,别抢工程师的活。这个思路对正在琢磨 AI 时代产品经理到底该干什么的管理者来说,值得拿来对照一下自己团队现在的样子。

AI 工程

涵盖 AI 工程技术实现与场景化开发的全流程,包含 Agent 工程架构、工具实践、上下文工程等核心技术话题。

1.Gemini 4 Argon:我们 frontiers 智能时代的下一章(Google DeepMind News)

Google DeepMind 刚甩出 Gemini 4 Argon,定价 2/10 美元,输出 token 上限从 64K 直接拉到 100 万,摆明了冲着复杂长程任务去的。更值得琢磨的是发布方式:先通过 Fairwind 计划开放给受信任的网络防御者,收集护栏反馈再逐步扩大。Google 内部拿它干了点硬活:量子子程序优化比公开基线高出 40%,智能体群分析全集群画像一口气释放 300 TiB 以上内存,libgav1 那 32K 行 SIMD 重写成安全 Rust 后直接快 2.7 倍。想观察前沿能力怎么和分阶段发布治理拧在一起,这是个一手窗口。

2.Claude Sonnet 5.5 发布:干活更快,单价不变(AINLP)

Anthropic 刚放出 Claude Sonnet 5.5,最直观的变化是出字速度快了三成以上,单任务花的钱最多能省三成,而单价一分没涨。真正值得看的是那笔账:在 CursorBench 4.0 上,Sonnet 5.5 开 Low 档的得分居然干过了 Sonnet 5 的 Max 档,平均步骤从 140 步砍到 18 步,一个任务的开销从 7.17 美元掉到 0.50 美元。不过别急着把所有档位拉满,FrontierCode 上 Xhigh 的表现反而比 Max 差,说明推理强度堆过头是会起反效果的。日常任务怎么选型号、effort 档位怎么配,这篇给的是能直接抄的实用参考。

3.「Claude Code with mods in TypeScript | Claude by Anthropic」(Claude Blog)

Anthropic 给 Claude Code 加了一套 mods 机制,说白了就是允许你用一堆很小的 TypeScript 函数挂到工具调用、权限请求、界面渲染这些事件上。挂上去之后能干的事情相当野:可以在事件之前跑、事件之后跑,甚至直接顶替掉事件本身——重写 prompt、拦截工具调用并在合适的时候重试、把输出里的敏感信息抹掉。再往前一步,内置功能也能被换掉,UI 可以加也可以改,而且现在已经有部分内置能力本身就是用 mods 交付的。代价得说清楚:它不跑沙箱,拿到的权限跟 Claude Code 本体一模一样,所以只该装可信来源的东西,来源不明的千万别碰。真正值得琢磨的是,开发者不再只是配置一个 Agent,而是能直接改写它运转的方式,工具从「厂商给你什么就是什么」变成「你自己拼出什么」,这一步分量不轻。

4.无人阅读的代码(Elevate)

Addy Osmani 把自己两年前的结论翻了案。当时他说,AI 生成的代码要逐行审查;现在他改口:不必每行都读,但每一处变更都得有一个「拥有发布决定的人」。逐行细读不是目的,只是提供问责的方式之一,而且未必是最划算的那一种。他给出的替代信任机制有几条:自动检查顶在前面,给变更划出爆炸半径的边界,测试必须独立于生成方,评审则人机混着来,各管各的盲区。

最有力的注脚来自 Teleport:13 名工程师用一个季度,发现了接近过去两年总和的高危漏洞。发现变便宜了,确认和修复没有——这句话值得贴在每个团队的墙上。工具能帮你更快地看见问题,但判断这究竟是不是问题、该不该放行、谁来签字担责,还是人的活。当智能体写掉大部分代码,评审这件事的重心就从读代码挪到了担决定:流程可以换,责任人不能空。

5.如何在 Harness 中构建模型路由器(LangChain Blog)

LangChain 把一个很实际的问题讲透了:模型路由器到底该放哪儿。他们的答案不是通用网关,而是 Open SWE 智能体的 Harness 里。做法也够硬核,先拉一周轨迹数据看清任务分布,再沿成本与智能的 Pareto 前沿挑三档模型,最后用 973 个线程做 A/B,质量没掉,中位成本直接降了 64%。真正有意思的是那个判断:只有 Harness 握着任务和领域上下文,路由才可能做对。想让个人智能体常驻身边,每一步的账就得先算清楚,这篇值得当成成本工程必修课来读。

6.AI Native 回忆录:稳定性前端 S1 实践复盘(阿里技术)

阿里稳定性团队的前端工程师王僖,把半年 AI Native 转型的坑和出路都写下来了。有个前提变化已经挡住很多人:写代码这件事,人人都能靠 AI 搞定之后,真正被漏算的是「生产之后」那一摊——对齐约定、交接评审、原型怎么处置,这些没人提前想清楚。他们试过三条看起来很常规的路:上课培训、建知识库、换平台,结果接连走不通。最后把顺序倒过来才找到出口:用结构化 Skill 加上 Anchor 插件,让规则在生成的那一刻就位,而不是等代码写完再回头补;设计和前端也不再共用一份代码,改成各自分库。文里还附了复用率和工期的实际数据,算是一个智能体大规模参与生产以后、质量机制怎么跟上的里程碑式案例。如果你也在推团队的 AI 化,或者正被「AI 写得快但接不住」折磨,这篇值得细看。

7.高德本地生活分析 Agent AI Native实践全景(万字长文)(阿里技术)

高德本地生活团队把一次 AI Native 转型拆得很细,万字复盘里没有停在概念层。他们先用 L0-L4 的能力分级把团队到底要走到哪一步说清楚,再用三层框架搭出一个能真正做经营分析的智能体。更值得看的是,资深分析经验不是留在人脑里,而是通过知识蒸馏和语义治理沉淀成可复用的数字资产。BI 工程师的角色也跟着变了:不再只是做报表,而是变成经营判断的设计者和守门人。对正在推企业 AI 落地的团队来说,这是一份少见的一手全景记录,能直接看到组织、能力、工程和角色怎么一起转。

8.每日脉动:RoR 作者再次引发‘手写代码终结论’辩论(The Pragmatic Engineer)

DHH 在 Rails World 上扔下一句话:37signals 已经「放下笔」,不再手写代码,还把 Opus 4.5 称作智能体时代的拐点。Ivan Klaric 顺着这个话头,把围绕软件质量的争论和几个真实 bug 案例串起来,得出的判断有点反直觉——软件工程不是被削弱了,反而更吃重。工程师得摸清 LLM 的特性,给智能体工厂搭一套验证系统,再用 linter 这类确定性代码兜底。正在被 AI 编程改造的一线工程师和技术负责人,这篇值得细读一遍。

9.AI Trading —— 决策便宜,行动很贵|对谈超 3w Star Vibe-Trading 作者浩哲(42章经)

金融市场的报价每秒都在刷新,做判断这件事几乎变得免费——真正让人手心出汗的是按下确认键的那一瞬间,因为交易不可撤回。Vibe-Trading 的作者吴浩哲做客 42 章经,把 AI Trading 的价值放在决策与行动之间那条通道上:它得可验证、可审计,而不是一个黑箱替你把钱扔进市场。他把这套系统拆成四层——模型、数据、数据对齐和 harness,并给出一个挺硬的观点:前面两层正在变成人人可得的公共品,后面两层才是接下来真正拉开差距的地方。做过量化或者搭过 Agent 的人应该会有共鸣,模型从来不是最难的部分,难的是喂给模型的数据是否干净、是否对齐,以及它的每一步动作能不能被追溯和复盘。这期对谈没停在概念层面,更像一份务实的工程地图。

其他

行业前沿与开源生态,整合行业深度洞察与开源技术动态的复合型主题,技术哲学、AGI 讨论、领袖观点。

1.2026 年 LLM 发展回顾(截至目前)(Simon Willison’s Weblog)

Simon Willison 把 WeAreDevelopers 闭幕演讲的注释讲义整理成了一份 2026 年 LLM 回顾,时间线卡得很具体:2025 年 11 月,Opus 4.5 和 GPT-5.1 让编码智能体从经常翻车变成日常能用。更带劲的是,他拿骑自行车的鹈鹕图表、Warelay 仓库第一个 commit,还有那句「要更有野心」的新年决心,串起独立开发者重新敢放手做东西的一年。眼下个人智能体成了各家争抢的新战场,这份能逐条核对的一手记录,正好拿来当背景板。

2.永恒的互补品(OpenAI News)

OpenAI 在 Intelligence Age 平台上开了个叫「下一个经济」的新系列,头一篇没聊模型又能刷多少分,而是抛了个挺反直觉的判断:天才机器最值钱的地方,也许不是替我们思考,而是替我们干那些无聊的活。文中搬出 Nick Bloom 等人的研究——要维持摩尔定律那样的推进速度,今天需要的研究者数量是 1970 年代的 18 倍,可整个经济的科研生产率反倒掉了 41 倍。也就是说,天才只是生产过程里的一项投入,真正的瓶颈在执行。这个视角对当下挺解渴:智能已经过剩,行动依然昂贵,于是「让个人智能体接管单调工作」不再只是发布会上的口号,而是一道实打实的经济学注脚。发布季的热闹散场之后,这是值得安静读完的一篇长文。


编辑此页