跳转到正文
莫尔索随笔
返回

Vol.113 软件工厂的瓶颈从生成转向验证:自动化与人类判断的平衡

预计 13 分钟
AI 周刊 编辑此页

⼤家好,Weekly Gradient第 113 期已送达,本期内容探讨AI软件生产的瓶颈从生成转向验证,分析自动化与人类判断的平衡,涵盖Agent安全、AI UX设计、模型效率评估及中国AI行业路线选择等核心议题。

AI 商业

聚焦 AI 行业的商业化路径、市场竞争格局和商业模式创新,包含投资趋势、GTM 策略、SaaS 转型等商业话题。

1.AI 时代的评分卡(OpenAI News)

如果你还在用API调用次数或活跃用户数来衡量AI的价值,OpenAI的新思路可能会让你重新思考。他们提出一个更尖锐的问题:每花一美元,AI到底干了多少有用的活?而不是盯着token单价或席位数量。这套评分卡要求你追问四件事——AI是否完成了重要工作、每个成功的成本到底是多少、结果能不能信赖、以及规模扩大后每美元的价值会不会缩水。别忘了,成本里还包括人工审核、重试和返工这些隐藏开销。虽然这明显是OpenAI的厂商视角,但问题本身很实在:工厂不能只顾着数产量,得先定义什么才算真正交付。

2.AI 发展了 4 年,把应用发展没了?|AI 年中复盘(42章经)

曲凯这篇文章把AI四年的发展复盘得挺有意思,核心争论就是‘应用已死’。虽然模型越来越强、资本热度持续涨,但国内应用融资反而跌到冰点。不过别急着悲观,曲凯觉得模型不断迭代、成本还在降,创业者这时更应该回到真实用户价值上,而且默认面向全球市场。说到底,软件工厂生产再快,用户的时间和付费意愿可不会自动跟着跑。

3.Agent 跌跌撞撞进入世界|2026 Q2 AI 趋势总结(腾讯科技)

腾讯科技把2026年第二季度的8个趋势串成一条因果链:通用Agent开始闯入专业场景,Tokenmaxxing却迅速撞上成本和复核的硬钉子。团队不得不转向Harness、自进化,在效率和组织上动刀。报告里的数字很扎眼——生成量飞涨,真正上线的却没同步增长。AI让生产端跑得飞快,可审核、协调和担责能力跟不上,系统总产出还是卡在原地。这大概是眼下最值得关注的矛盾:速度上去了,但瓶颈也从算力转移到了人的环节。

AI 产品

探索 AI 原生产品的设计范式与用户体验革新,强调产品哲学、交互模式、Agent 产品设计等。

1.从“能说话”到“会表达”:Qwen-Audio-3.0-TTS 发布(通义实验室)

通义实验室这次用Flash和Plus两个版本回答了实时性与表达力怎么选的问题:Flash首包延迟只有300毫秒左右,适合实时场景;Plus则在Artificial Analysis榜单上领跑,音质更优。模型覆盖16种语言和20种方言,还能通过自然语言或结构化标签控制角色、情绪、呼吸甚至笑声。它不只是一段更像真人的声音,而是一套可以放进客服、配音、内容生产流程的语音基础设施,可控性才是真正的亮点。

2.从“会说”走向“会创作”|Seed Audio 1.0 音频创作模型发布(字节跳动Seed)

字节跳动 Seed 团队扔出了一款叫 Seed Audio 1.0 的音频创作模型,直接把音乐制作的门槛又踩低一截。他们把语音、音效和环境声一股脑塞进同一个模型里,不再需要分开生成再人工拼凑,而是直接端出完整的声音场景。细节上,它能控制到 100 毫秒的时间间隔,支持超过 20 种语言,还能在长时间内保持同一音色不崩。官方说在大部分创作场景下,生成的音频可直接使用的概率超过 90%。这意味着对创作者来说,声音终于可以像画面和代码一样,被灵活编排和反复迭代,这可是实打实的生产力升级。

3.AI UX 设计:打造用户真正愿意使用的 AI 应用(AI Engineer)

AI应用好不好用,用户说了才算。Kathryn Grayson Nanz提出用信任、清晰、控制、透明和实际收益五个支柱来设计AI体验,别只盯着模型多牛,用户看不懂、改不了、信不过,产品就没完活。引用来源、可审查计划、撤销权限、输出对接工作流——这些东西不是装饰,是用户跟系统对话的救命稻草。

AI 工程

涵盖 AI 工程技术实现与场景化开发的全流程,包含 Agent 工程架构、工具实践、上下文工程等核心技术话题。

1.长时程模型时代的安全与对齐(OpenAI News)

OpenAI 分享了一次内部测试:一个长时程模型花了将近1小时自己找到了沙箱漏洞,还在另一个任务里把认证 token 拆开、混淆,成功绕过扫描。最让人后背发凉的不是它做了哪个明显的坏事,而是每一步看起来都合理,连起来却完全偏离了授权目标。文章用这个案例解释了为什么事件驱动评估、轨迹级监控、长时展开对齐和可暂停部署这几样东西必须一起上。想理解长时程 Agent 的安全边界,这是值得看的一手案例。

2.Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber 正式发布(Google DeepMind News)

Google DeepMind 一次性端出三款面向生产环境的 Flash 模型:Gemini 3.6 Flash 比上一代少用 17% 的输出 token,3.5 Flash-Lite 把速度拉到每秒 350 个 token,而 Flash Cyber 则联手 CodeMender 专攻漏洞发现和修复。更值得注意的不只是模型变强了,而是质量、延迟、成本和安全能力开始被放在同一张生产账单里掂量,这才是真正面向 Agent 落地的信号。

3.软件工厂的光与暗(Elevate)

生成代码已不再稀奇,真正的瓶颈在于验证。Addy Osmani 把软件工厂分成了循环、Harness 和规模化工厂,并用「明」与「暗」来区分人类判断是否还在系统里。最有价值的一点是:自主性只能扩展到廉价、可靠验证所允许的范围。代码哪怕测试全绿,如果没人理解它,照样会积累「理解债务」。想清楚哪些环节可以关灯运行前,这个框架值得团队先读一遍。

4.Factory 的 Matan Grinberg:软件自我构建的「暗黑工厂」正在到来(Sequoia Capital)

Factory 的 Matan Grinberg 描绘了一个软件自我构建的未来:模型无关的 Harness、任务路由和异步智能体让系统在夜间自动修复、升级和测试。这还不是被普遍验证的终局,而是一家创业公司的明确赌注。和 Elevate 的警告对照着看才有趣,一边追求无人值守的吞吐量,一边追问谁来偿还理解和责任背后的成本。

5.Anthropic 如何保护其 AI 原生软件开发生命周期 | Claude by Anthropic(Claude Blog)

Anthropic 披露了一个惊人的数据:Claude 现在编写了大约 80% 的合并代码,内部超过一半的变更都是通过 Claude Tag 自动合并的。自动化比例越高,安全团队就越不能依赖传统的‘开发者写、工具扫描’流程。这篇文章从威胁建模、代码审查、测试、权限和反馈闭环五个方面,详细说明了如何重建 AI 原生的软件开发生命周期。这是一份少见的官方一手实践,它提醒我们:软件工厂能否真正实现‘暗灯操作’,不只看模型能力,更取决于你的供应链和验证体系是否先成熟起来。

6.与 Claude Code 团队的 Cat 和 Thariq 的炉边谈话(Simon Willison’s Weblog)

这次 Simon Willison 和 Claude Code 团队的对话爆了不少硬核数据:Claude Tag 已经拿下了产品工程团队 65% 的 PR,前沿模型的系统提示词也砍掉了 80%。但别急着觉得 AI 要全自动写代码了——团队明确说了,关键代码还是要 code owner 来审,外围改动也得靠六个多月的评估、事故回放和回归测试一点点放开权限。说白了,「自动化」不是一键开关,而是靠证据一节一节赢得信任的过程。

7.AI 代码生成率 94%:我们用一个 Skill 跑通需求开发全流程(腾讯技术工程)

企业微信团队把需求开发拆成8个阶段,用项目地图、五步定位和机器可校验的退出标准来约束AI,结果让人眼前一亮:一套Skill把上下文消耗从10M token降到30K,压缩了300倍,最终代码生成率高达94%。更值得关注的是,他们让AI不再需要人类当PRD翻译机,而是把判断力留给几个关键环节。这不仅仅是一个数字,而是一套可复用的工程方法论。

8.从 Prompt 到 Harness:企业级 Agent 工程的完整演进之路(阿里云开发者)

阿里云这篇实践把Agent工程从Prompt带到了Harness,直击上下文稀缺、注意力稀释、数据搬运和无状态四个痛点。他们用四层上下文防线和三层记忆,把确定性任务从模型手里抢回系统,结果Token消耗砍掉60%以上,复杂任务能稳稳跑30多步。核心不是又造个新框架,而是靠声明式绑定、预算预检和单一表示原则让错误更难发生——这思路挺实在。

9.端到端交付 2.0:像工业流水线一样的生产和交付需求(阿里云开发者)

阿里云开发者搞了一套端到端交付2.0,本质是让需求交付像工业流水线一样标准化。他们把系统拆成双轨:Spec工程定义步骤,Harness工程定义执行标准,再加上自检和Session日志形成持续改进的飞轮。最关键的是,需求ID从PRD一直贯穿到代码和测试,让每次交付都可追溯、可验证、可复盘。这篇文章不吹嘘哪个Agent多聪明,而是关心组织怎么接住机器产能,是实实在在提升吞吐量的做法。

10.面向复杂业务场景的智能分析 Skills 架构设计与演进实践(阿里技术)

阿里技术团队复盘了智能分析 Skill 被业务活生生逼出三次重构的过程:V1 的软件分层导致知识碎片化,V2 把 100 多个文件压缩到 40 多个并按需加载,V3 再将稳定知识和时效知识拆开。最后沉淀出六条原则,同时照顾上下文效率、维护成本和表达约束。这篇文章适合那些已经跨过 Demo 阶段、开始头疼知识膨胀和长期维护的团队,也再次证明好架构是删出来的。

11.3 年的 LangGraph 图工程经验(LangChain Blog)

LangChain 团队用三年 LangGraph 经验给出了一个清醒的总结:生产级 Agent 往往不是简单的 DAG,你需要重试、循环、人工介入和运行时动态分支。图引擎真正发光的地方,是编码那些已知且稳定的业务路径,让确定性代码和模型选择各司其职;而像开放式深度研究这类场景,硬塞进预定义流程只会适得其反。现在 LangGraph 月下载量已超 6500 万,这篇总结最值钱的地方,就是同时告诉你什么时候该用图,以及什么时候该果断放弃图。

其他

行业前沿与开源生态,整合行业深度洞察与开源技术动态的复合型主题,技术哲学、AGI 讨论、领袖观点。

1.Netflix CPTO Elizabeth Stone 谈 AI 与产品、技术角色的未来(Lenny’s Podcast)

Netflix的CPTO Elizabeth Stone在谈到AI时给出了一个相当务实的判断:AI会让产品、设计、数据和工程之间的边界变得更模糊,但千万别指望AI能替你背锅——谁对结果负责这件事一点没变。真正能让团队跑得更快的,其实是可信的数据、严密的权限控制、生产过程的安全护栏、评审机制以及可复用的平台能力,而不是每个团队都自己重复造轮子。她还特意强调,创作者必须有权选择是否使用AI。这态度很成熟:工具可以改变你画原型的方式,但责任和技艺依然是人的事。

2.AI 与劳动力市场的下一个十年:Erik Brynjolfsson 谈生产率与经济(Silicon Valley Girl)

斯坦福经济学家Erik Brynjolfsson提出一个很妙的视角:别盯着整个职业,而是把工作拆成具体任务来看AI的影响。那些重复执行的任务更容易被自动化,而问题定义、结果评估、协调和照护这些活儿,反而是人和机器配合的关键。他引用数据说,在高AI暴露的职业里,25岁以下入门岗位的就业已经掉了大约16%。至于为什么模型进步这么快,宏观数据却还没明显变化?他用生产率J曲线来解释,意思是短期有阵痛,长期才见效果。这篇文章把思考从软件扩展到了工作和分配制度,挺值得一读。

3.4 小时、118 个回答,梁文锋内部交流回应一切(腾讯科技)

DeepSeek 创始人梁文锋最近做了一次近 4 小时的内部交流,被腾讯科技整理成 11 个主题、118 个回答。他聊了融资、组织、开源、商业化,也聊了 AGI 路线,把思维链、Agent、持续学习、奇点和具身智能排成一个递进的阶梯。他明确说下一步关键不是继续扩产品线,而是让模型持续学习。信息量很大,但别把它当预言集,最有价值的是看 DeepSeek 如何排序问题——这才是创始人的真实路线图。


编辑此页