INDEX / NO.033 — 2026.08.12 — 热点解读

Jeff Dean离开谷歌搞了个 Discovery Loop 是干什么的?

创办了 Discovery Loop。为什么第一站是机器学习?这条路线最难的又是什么?

今天的 AI 已经能检索论文、总结研究和生成假设,但科学研究最终需要的不是更多看起来合理的想法,而是经得起实验检验的新知识。

Jeff Dean 离开 Google,与 Sanjay Ghemawat、Quoc Le 和 Oriol Vinyals 共同创办了 Discovery Loop

发布公司时,他把方法讲得很直接:提出实验,完成实现并运行,查看结果,再根据结果继续迭代。Discovery Loop 想把这条依赖人工反复推进的实验循环自动化。

公司的目标横跨机器学习、科学和工程,第一站却是机器学习研究。Discovery Loop 还计划把自己作为第一个客户,先用这套能力改进自己的技术栈,再向其他领域扩展。

这个顺序很实际。机器学习实验可以由软件执行,反馈较快,结果也相对容易量化,适合先检验整条实验循环能不能自动运行。

自动化的对象是实验循环

完整循环至少包括五步:

提出候选方案
→ 转成可执行实验
→ 运行并采集结果
→ 评价结果
→ 决定下一批方案

Discovery Loop 官网使用的原文是“experimental loop”,直译为“实验循环”。它想把模型、执行环境和评价系统接起来,让结果直接影响下一轮探索,并在条件允许时并行运行更多实验。下文把这种首尾相接的机制简称为“闭环”。

Discovery Loop 将科学与工程过程概括为提出实验、执行实验、评价结果并继续迭代的循环

Discovery Loop 公布的实验循环(experimental loop):提出实验、执行、评价,再把结果送回下一轮。来源:Jeff Dean

多生成一千个点子未必创造价值,筛选成本可能一起增加。闭环的意义是让候选方案尽快遇到现实反馈,把失败变成下一次搜索的输入。

一个科研助手可以缩短其中某一步。Discovery Loop 想提高的是整个循环的有效迭代速度。

为什么先从机器学习开始

模型结构、训练方法、系统参数和代码实现都可以转成软件实验。一次运行结束后,准确率、耗时、内存占用和计算成本会提供反馈,系统可以据此调整方案和重跑。机器学习因此让执行、反馈和初步评价三个环节更容易自动化。

按 Google DeepMind 的公开介绍,AlphaEvolve 已经展示过相近的机制:用 Gemini 生成候选程序,由自动评价器验证、运行和评分,再通过进化搜索继续改进。Google 公布的应用包括数据中心调度、用于 TPU 算术电路的 Verilog 改写和模型训练内核。

目前公开资料没有说明 AlphaEvolve 与 Discovery Loop 存在架构继承关系。AlphaEvolve 能说明的是,在程序可执行、结果可自动验证的计算任务中,大模型可以进入“生成—评估—筛选—再生成”的搜索闭环。

药物和材料研究的反馈条件要苛刻得多。实验可能需要机器人、昂贵仪器和更长周期;测量会有噪声;一个指标改善,也未必代表研究方向成立。代码可以自动检查能否运行,科学发现还要经受复现、因果解释和同行审查。

机器学习还有一个组织优势。Discovery Loop 计划先把系统用于自己的技术栈,不必一开始就让外部实验室更换工作流。如果系统能改进训练效率、模型结构或底层代码,团队既得到产品反馈,也可能增强下一轮实验所依赖的模型和基础设施。

机器学习并不比药物或材料更能代表科学发现,但它数字化程度高、反馈链路短,公司又能内部自用,适合先检验整个实验循环能否跑通。

这家公司要建什么

自动实验循环的瓶颈不只在模型。候选方案生成以后,还要有人或系统负责执行、调度、评价、记录和复用结果。

Discovery Loop 的四位创始人是 Jeff Dean、Sanjay Ghemawat、Quoc Le 和 Oriol Vinyals。他们曾领导或参与 TensorFlow、Pathways、TPU、seq2seq、AlphaStar 和 Gemini 等项目。

Discovery Loop 四位创始人合影

Discovery Loop 四位创始人,从左到右为 Oriol Vinyals、Sanjay Ghemawat、Jeff Dean 和 Quoc Le。来源:Discovery Loop 官方发布

这些经历覆盖模型、搜索算法、分布式基础设施和产品级系统。要让这条路线成立,系统还得把研究问题转成可执行实验,在大量实验之间分配算力,并把评价结果送回下一轮。Jeff Dean 在官宣帖中也强调,这件事同时需要机器学习和大规模系统能力。

跑通之后,价值可能在哪里

更难复制的部分,可能是闭环运行以后积累的评价系统、实验记录和调度经验。

论文通常不会完整呈现每一次失败尝试,自动实验系统则有机会保留更连续的实验轨迹:什么方案在什么条件下试过、为什么失败、下一次怎样改。只有当记录足够结构化、评价可信、结果能够复用时,这些轨迹才可能成为数据资产。

如果机器学习里的实验循环成立,Discovery Loop 会先缩短内部模型和系统改进的反馈周期,也可能帮助外部工程团队承担更多实验、减少重复试错。再往后,它可以尝试把经过数字实验验证的执行、评价和调度能力接到实验室、仪器与领域专家。

从数字实验迁移到物理实验,不能只更换数据源,还要重新处理设备、样本、噪声、安全和专业判断。这是公司目标里最不确定的一步。

这条路线可能怎样失败

评价器失真,是自动实验闭环的关键风险之一。

如果评价器只奖励局部指标,系统会更快地优化错误目标。模型和评价器如果存在相似偏差,还可能互相确认,制造出持续改善的假象。实验数量越多,错误目标造成的浪费越大。

机器学习阶段要先证明,实验结果确实进入了下一轮,评价器没有被候选方案投机利用,改进离开内部测试后仍然成立。

迁移到物理实验后,还会新增实验权限、危险方案、数据质量和外部复现等问题。即使整个实验循环能够自动运行,人也不会因此退出,而会更多地负责定义目标、检查评价方式、处理异常,并决定哪些结果值得相信。

截至 2026 年 8 月 5 日,官网和官宣材料显示,团队近期将招聘、寻找办公场地,并开始建设基础设施、模型和系统;这些材料没有展示可供外部验证的产品、技术报告或研究结果。创始人的履历说明他们有能力尝试,不能提前证明结果。

接下来判断 Discovery Loop,不必盯着它能生成多少实验。更重要的是,它能否公开跑通“提出方案—执行—评价—继续迭代”的完整闭环,评价器能否抵抗投机取巧,内部改进能否被独立团队复现。等这些成立以后,再看机器学习里积累的方法能不能迁移到其他领域。

这套判断也适用于其他 AI 产品

Discovery Loop 选择机器学习作为起点,提供了一种比宏大愿景更实用的产品方法:先找到一个范围较窄、能够执行、评价和快速获得反馈的循环,在内部跑通,再进入更复杂的环境。

判断其他 Agent 或 AI 产品时,也可以问四个问题:

  • 模型的输出会在哪里被执行?
  • 执行以后,用什么信号判断好坏?
  • 结果能不能进入下一轮?
  • 哪些目标、权限和异常必须交给人?

这四个接口可以帮助判断,一个产品是在生成内容,还是在持续完成工作。

参考资料

扫码关注公众号
扫码关注公众号
扫码加群交流
扫码加群交流