⼤家好,Weekly Gradient第 115 期已送达,本期内容聚焦个人AGI,探讨如何将上下文、Skill与责任沉淀为可持续资产,强调验证环境、控制层和模型选择权,并涵盖前沿模型进展与开源生态价值。
AI 商业
聚焦 AI 行业的商业化路径、市场竞争格局和商业模式创新,包含投资趋势、GTM 策略、SaaS 转型等商业话题。
1.对话李开复:小人物的机会,在哪里?(刘润)
李开复和刘润聊了聊,从企业里怎么真用上 AI,到普通人能从这波浪潮里捞到什么。他点出一个关键区别:光用 AI 给老流程贴金叫「赋能」,真正把流程拆了重新做才叫「原生」。企业要真想落地,得先把数据叫醒,让最高负责人亲自下场,再找个明确背锅的人对结果负责。对个人来说,他用 OPC 概念讲了 AI 怎么把创业和服务客户的门槛砸低。最有嚼头的不是那些宏大预测,而是他强调的那些东西——责任、判断、死磕和愿景,还是得人来扛。说白了,杠杆越大,掌舵的人越得为方向负责。普通人的机会不在空想 AGI,而是低头找到一个你愿意长久负责的具体问题。
2.AI 不自动带来超级组织(腾讯研究院)
AI真的会催生超级企业吗?腾讯研究院王健飞泼了盆冷水。他质疑那种‘AI一上,组织就变强’的叙事,反而觉得个体如果拿到更强杠杆,企业边界可能后退——人才带着隐性知识出走,自己就能干,微型竞争者会冒出来。有个数据很扎眼:2025年企业花在生成式AI上的钱,76%都流向了外部采购。顺着这个趋势推演,未来可能是平台越来越集中,应用越来越碎片化,小经营单元更多。当然,后半段更像是作者的大胆假设,不是既成事实。但这份推演提醒我们,当AGI落到个人手里,能力、议价权和风险分配都会变。有意思的正是这种张力:个体更自由了,却也更容易被市场波动和平台依赖裹挟。读起来挺带劲的,值得琢磨。
3.Patrick Collison:当你成功之后,AI 时代如何继续创造机会?(Y Combinator)
Patrick Collison 在 YC 的分享里提出一个有意思的说法:把已经掌握的知识当成“认知缓存”。就算 AI 能随时检索事实,那些留在脑中的概念依然能帮你更快地思考和判断。所以他依然重视编程基础、写作、沟通和挑选机会的能力,还拿自己两次离开 MIT 又回去的经历说明很多决定其实可以反悔。这篇文章的乐观很扎实:企业换新产品是因为维持现状也有风险,个人想靠 AI 创造机会,前提还是深入的理解和确实存在的客户需求。年轻创业者不必因为工具变了就丢掉基本功,也别把一次选择当成一辈子的事。
AI 产品
探索 AI 原生产品的设计范式与用户体验革新,强调产品哲学、交互模式、Agent 产品设计等。
1.一镜成片,随心参考|Seedance 2.5 正式发布(字节跳动Seed)
Seedance 2.5升级不小,一次能生成30秒视频,还能同时参考30张图、10段视频和10段音频,多模态混着用。时间戳编辑、绿幕、运镜控制这些功能,让它更像影视和广告制作里的实用工具,而不是只能玩玩。但官方也没藏着掖着,物理合理性和多主体互动还是有短板。我关心的不是单个样片有多惊艳,而是这种多模态参考、长叙事和精细编辑开始整合到同一套工作流里,这才有可能改变做视频的方式。不过真要把它纳入生产流程,还得看角色一致性、修改成本,以及团队协作时能不能稳定复现。
2.Claude Code Auto Mode 如何工作:独立审查、双层防护与可配置的信任边界(Claude)
Claude 的第一方说明拆解 Auto Mode 如何降低长任务中的频繁确认,同时保留独立审查。分类器只能看到用户消息与拟执行的工具调用,服务端还会先探测工具结果中的提示词注入;既有 deny、ask、allow 规则优先,难以撤销或影响外部环境的操作才进入风险判断。它给出的上线建议很克制:从较窄信任边界开始,团队策略集中管理,高风险生产变更继续人工复核或自建评测。推荐把它当作权限设计参考,而不是自动模式已经可以覆盖所有风险的证明。
AI 工程
涵盖 AI 工程技术实现与场景化开发的全流程,包含 Agent 工程架构、工具实践、上下文工程等核心技术话题。
1.Qwen3.8-Max:编程与办公,全面跃升(千问大模型)
千问这次发布的 Qwen3.8-Max,最抓人的不是参数规模——2.4 万亿总参数、950 亿激活,也不是 100 万上下文,而是它真正开始从“回答问题”转向“自主交付长程任务”。官方演示覆盖了编程、科研、办公和多步骤经营,还透露了环境解耦、统一奖励、在线数据均衡这些强化学习的具体打法。模型能力上限和训练思路都值得一读,但演示效果得留个心眼,边界可能没那么宽。对开发者来说,权重开放后能不能在真实环境里复现这些长程任务,才是更值得盯的点。
2.从 Kimi K3 技术报告看前沿模型是如何炼成的(Towards Data Science)
这本47页的技术报告藏着不少硬货,Sean Moran把它掰开揉碎讲清楚了。2.8万亿总参数、每token激活1040亿,896个专家只抽16个,百万上下文全靠这些工程细节撑起来。但最让人拍案的是训练和服务环节——可验证环境防作弊、九专家蒸馏、前缀缓存加会话绑定,这套组合拳才是前沿模型落地的真功夫。第三方解读的好处是能跟原始报告对照着看,把算法、数据、训练到在线服务全串进一张工程地图里。想搞懂前沿模型怎么从论文变成实打实的产品,这篇值得细读。
3.推理工程大师课 — Philip Kiely 与 Ali Taha,Baseten(Latent.Space)
搞推理的同学千万别错过这期对话。两位来自Baseten的工程师从一个20万token的真实请求讲起,把生产级推理的底裤都翻出来了:缓存感知路由、预填充和解码分离、量化与硬件适配,一层层剥开。最亮眼的案例是GLM-5.2在保持质量的前提下,用跨层量化换来了约20%的吞吐提升,实打实的收益。而且他们不只看性能数字,还聊了长视频注意力、非确定性故障,以及训练和推理如何闭环。看完你会明白,模型服务不是’部署一个端点’就完事,而是性能、成本和可靠性的系统工程。特别建议基础设施团队重点读故障与取舍那部分——真正的推理优化永远不是单项指标的游戏。
4.我们在六个月内构建了用于响应式语音 AI 的实时系统(OpenAI News)
OpenAI 工程团队分享了 GPT-Live 重构六个月的全过程。全双工模型本身能边听边说,但真正折腾人的是把推理、上下文和媒体传输捏合成一套可扩展的低延迟系统。文章里提到了不少硬核设计,比如有状态推理、异步委派、动态上下文压缩,还有为了缩短建连时间搞的 WARP 和 Instant Connect。最有价值的是他们怎么用影子流量把地域、长会话和观测盲点这些坑都暴露出来——这提醒我们,实时 AI 的体验从来不是单靠模型,而是整条链路的系统工程。对做语音产品的团队来说,这份从 demo 到生产环境、从并发控制到可观测性的复盘,绝对值得一读。
5.Cloudflare OS:面向智能体、应用与工作的开放平台(The Cloudflare Blog)
Cloudflare 把自家数千员工用智能体的实践经验打包成了一个叫 Cloudflare OS 的开源平台。它不是又一个聊天式工作区,而是把组织上下文、可复用的 Skill、隔离执行环境、细粒度的 Gatekeeper 和数据血缘全塞进同一个治理框架里。这样一来,个人做的应用不仅能给人用,也能给智能体调用。它给出一个重要思路:想让个人杠杆真正复利,光有工具不够,还得有可持续的上下文和明确的权限边界。这是来自 Cloudflare 内部的一手架构说明,挺值得关注。不过别急着照搬,适不适合你的组织,还得看你已有的身份体系、数据治理和员工使用习惯能不能兼容。
6.模型越来越强, harness 该留下什么?(腾讯云开发者)
模型能力越来越强,那原本为弱模型准备的提示和工具链是不是该瘦身了?腾讯云 TDSQL 团队做了一次大胆实验:根指令砍掉 61%,Skill 减少 40%,Agent 从 10 个压到 6 个。他们把需要写进 harness 的内容分成四层——公开知识、平台能力、组织流程、责任判断,主张只保留模型搞不定的部分,也就是 L2 和 L3。最实用的是那五道机械关卡,从要不要写、能不能用判据衡量、验收标准收紧到先建评测,帮你把宝贵的上下文留给真正有差异的约束。这套思路同样适用于个人知识库,定期清理旧规则,别让过时的约束拖累新模型。
7.从 Spec 驱动转向环境与验证驱动——我对 AI Coding 的一点思考(阿里技术)
如果你以为把代码生成模型的分数刷上去,就能让研发效率水涨船高,那这篇来自阿里技术团队的文章可能会让你重新想想。他们给出的内部观察是:代码生成在整个研发链路里只占两到三成的工作量,剩下的构建、部署、测试、日志、监控、发布,这些环节才是真正消耗时间的地方。就像阿姆达尔定律说的,系统的瓶颈会迁移,光是优化局部,整体收益可能很有限。真正值得下功夫的,是把这些环境都变成AI能调用、能验证的接口,让每一次改动都得到客观反馈。文章里还分享了几条实践的路径:知识库怎么沉淀、可复现的环境怎么做、分层验证怎么设计,以及如何把系统串起来。读完之后你会感觉到,一个靠谱的AI助手,不只是会写代码,更重要的是能在一个能验证的环境里不断试错、纠偏,这才算补上了判断力成长的闭环。
8.从 Agent Flow 到 AI Native:为什么通用 Agent 是“饮鸩止渴”(阿里技术)
当所有人都在追逐通用 Agent 时,这篇文章泼了一盆冷水。作者从自己搭建 Agent Flow 的实际经验出发,认为把一切都交给大模型是“饮鸩止渴”。他主张把复杂工作拆成一个个可验证的最小任务单元,让确定性的代码和流程去承载稳定部分,而不是让模型包打天下。更尖锐的是,他重新为 hardcode 正名:在目标明确的场景里,别急着抽象,快速解决问题才是真。这不是一篇迎合共识的文章,但它逼你回答一个问题——你的系统里,哪些能力该交给模型,哪些边界必须自己守住?
9.多模型路由的现状:为 AI 系统建立生产级控制层(AI Engineer)
AI Engineer 圆桌里,NVIDIA、Cognition 和 OpenRouter 凑到一起,聊生产系统为啥会长期用多模型路由。结论是:强模型适合规划、监督和难判断,小模型或专用模型负责边界清楚的任务,而真正的控制层还得会识别分布外请求、处理委派失败、评估 KV 缓存价值,并应对供应商限制。三方都反对只看排行榜选模型,觉得该围绕具体子任务建评测和升级机制。这给个人智能系统提了个现实架构:所有权不等于只用单个模型,真正的选择权来自可替换的接口、真实任务数据,还有在失败时主动升级的能力。
10.快手 AI 研发范式升级新路径:从研发提效到组织跃迁(快手技术)
快手的技术团队复盘了这几年AI研发的路径,他们发现一个关键点:代码生成率并不等于组织效能。虽然有三成员工的代码生成占比超过40%,但还有32%的人低于10%,这背后的差距其实来自人与人、人与流程、人与AI之间的协作摩擦。他们把转型分成三个层次:L1工具变、L2组织变、L3业务与组织同变,还提到FDE、PDE这类角色重构的案例。这是一份大型组织的内部实践,读的时候最好关注转型机制和适用条件,别把那些单点比例直接套用到别的公司。
11.AWS 老兵:新的软件开发生命周期(跨国串门儿计划)
如果你对AI编程的认知还停留在“会写提示词就行”,那这期节目可能会颠覆你的想法。AWS老兵Heitor Lessa给1400名工程师搭了一套完整的Agent开发流水线:从客户需求发现、路线图制定,到用Open Spec明确规格,再让三档不同能力的模型各司其职,最后还要过对抗性评审和合并门禁,跑完一轮再复盘。这套流程把产品发现、实现、验证和改进串成了一个闭环,不是靠某个魔法命令,而是靠系统化的工程纪律。他还特别强调本地优先开发、主动学相邻技能,以及用苏格拉底式提问逼出真问题。对个人开发者来说,这就是一份把AI工具用成生产力系统的实战手册,光是借鉴其中的评审和复盘机制,就能让你的项目质量上一个台阶。
其他
行业前沿与开源生态,整合行业深度洞察与开源技术动态的复合型主题,技术哲学、AGI 讨论、领袖观点。
1.开放通用智能,MiniMax H3 正式开源(MiniMax 稀宇科技)
MiniMax 这次把 H3 系列开源了,但别急着欢呼——H3-Base 是核心,支持文本、图像、视频和音频输入,能生成 4 到 15 秒、最高 2K 且带立体声的视频。技术链完整,从视觉和音频 VAE 到单流 Omni-Transformer,再到上下文再生成方案,还给了本地部署和推理框架适配信息。不过要注意,H3-Context-IR 只提供托管 API,H3-Regenerate-2K 还没开放,所以它更像是组件级开源,不是全开放。对想自己部署的团队来说,许可、显存成本、组件依赖和可复现效果都得掰开算,别被“开源”俩字忽悠了。
2.个人 AGI:掌握上下文、技能与复利式杠杆(Y Combinator)
Garry Tan 在 YC 演讲里抛出的「个人 AGI」概念,跟那种租个最强模型来用的思路完全不同——它是让你自己慢慢积累上下文、技能、记忆和工作判断,把模型判断跟代码、数据库这些确定性系统分开,从一个资料库、一项重复任务、一个可调度的 Skill 开始,一步步搭起真正属于你的智能基础设施。最戳人的是所有权这一点:你流程里编码的经验,应该继续为你复利,而不是给别人做嫁衣。这不是喊「一人替代整家公司」的口号,而是一套能落地的个人系统。文章还给了足够小的起步动作,正好拿来检查一下,你的智能资产到底能不能迁移、能不能复用。
3.178: 与田渊栋聊 RSI:模型自进化如何到来?(晚点聊 LateTalk)
这期播客聊的是模型自己改自己这件事到底怎么落地。田渊栋把 RSI 和传统 AutoML 划清界限,说现在大模型开始碰问题定义了,但品味、抽象、创造力还有可靠的验证方式,依然是绕不过去的坎。他提到能力可能是台阶式往上跳的,也聊了初创团队该往哪个缝隙里钻。注意,这些都是研究者和创业者的判断,别当成板上钉钉的结论。最值得琢磨的是:递归改进需要什么样的反馈回路和约束条件?越接近自我改进,验收机制就越不能被模型自己糊弄过去。这正好和同期工程内容对上——想让它自己进化,先得想清楚怎么不被它骗。
4.科技爱好者周刊(第 407 期):国家为什么需要开源软件?(阮一峰的网络日志)
阮一峰的最新周刊从 Kimi K3 和美国科技公司的公开信切入,问了一个挺扎心的问题:国家为什么需要开源软件?他的核心判断是,开放生态能扩大参与、促进竞争,防止单一路线被少数平台垄断——这套逻辑放在哪个国家都成立。除了开头的长篇讨论,后边照旧是工具、资源和科技见闻的盘点,但卷首那篇最值得看。要注意的是,这些政策和经济上的推断更多是作者个人观点,不是已经证实的因果结论。另外,这还关系到“个人 AGI”的前提条件——你能不能真正掌握自己的智能资产,取决于模型和工具给不给你迁移和再创造的自由。