实验室自动化把手艺变成数据之后,谁还在看异常?

本文讨论实验室自动化在编码隐性知识时滤掉了什么。读完你会得到一个区分“可重复”与“可发现”的框架,以及判断一条自动化流程是否仍保有纠错能力的几个迹象。

science

自动化实验室和 AI 代理正在快速接手实验科学里重复度最高的那部分工作。通常的账本只有一栏:通量更高、误差更小、可重复性更好。这篇想补上另一栏。问题是:当隐性知识被编码成协议和数据时,没被编码的那部分原本在做什么?我的判断是,它承担着识别异常和自我纠错的功能,而这项功能正在被一并滤掉。现在讨论它,是因为 AI 已经开始在发现端交出结果,而科学共同体对“谁来判断结果是否可靠”的讨论才刚刚开始。

编码不是搬运,而是一次选择性转译

“隐性知识”通常被追溯到 Michael Polanyi 的那句话:我们知道的,多于我们能说出的。社会学家 Harry Collins 在 1970 年代追踪 TEA 激光器的复制过程时发现,按照已发表的文献和图纸,几乎没有实验室能独立造出能工作的装置;成功复制的团队,基本都与原作者有过人员往来(Collins, The TEA Set[1])。知识沿着人流动,而不是沿着论文流动。

但“隐性知识”这个词太粗了,粗到无法讨论自动化究竟拿走了什么。我建议把它拆成两层。

  • 操作性知识:关于“怎么做”的默会经验,如移液节奏、孵育时长、离心前的平衡。它难以言传,但原则上可以被拆解成参数,写进协议,交给机器执行。
  • 判别性知识:关于“这次是否正常”的判断能力。它依赖连续的感觉反馈、对“正常结果”分布的默会预期,以及在情境中察觉偏离的能力,很难事先写成规则。

自动化擅长的是前一层。把一个资深技术员的手法拆成步骤、参数和容差,正是实验室自动化工程师每天在做的事。问题出在后一层。判别性知识在手工操作里不是一个独立的工序,它附着在每一次操作上:拿起离心管时看到的浑浊、加样时觉得“今天的液体有点黏”、凝胶跑出来那一刻的“不太对”。

所以,编码不是把手工流程原样搬进机器,而是一次有损转译。协议能记录的,是被事先认定为相关的变量;而异常之所以是异常,恰恰在于它落在事先认定的变量之外。

编码是有损转译:操作步骤进入标准化流程,异常感知与情境判断留在漏斗之外 手工流程 操作步骤 感觉反馈 情境线索 异常信号 编码进 协议与数据 标准化流程 协议步骤 仪器读数 质控参数 未被编码:异常感知、情境判断
图 1 | 编码是有损转译:操作步骤进入标准化流程,异常感知与情境判断留在漏斗之外 · 来源:一目半绘制

这样一来,问题就不再是“自动化好不好”,而是“编码过程滤掉了什么,以及被滤掉的东西原本承担什么功能”。

异常为什么最难写进协议

判别性知识难以编码,至少有三个原因。

第一,它依赖连续反馈。手工操作者在整个过程中持续接收视觉、触觉和时间上的信号。仪器当然也有传感器,但传感器只记录设计者事先决定要记录的量。

第二,它依赖一个默会的“正常”分布。一位做了几百次同类实验的研究者,脑子里有一条关于“结果通常长什么样”的经验分布。偏离这条分布的结果会引起警觉。这条分布从未被写下来,它是在反复操作中训练出来的。

第三,它依赖“这次不一样”的情境判断。一个读数偏高,是试剂批次问题、操作失误,还是真实的新现象?这个判断要调动的是实验之外的知识:这批样本从哪来,昨天设备做过什么维护,文献里有没有类似报道。

一个经常被引用的例子能说明判别性知识的分量。2014 年,Mina Bissell 与 Kornelia Polyak 两个实验室在 Cell Reports 上撰文回顾:两边用看似相同的方案分选人乳腺细胞,却得到不一致的结果;反复排查后,差异被追溯到组织消化时的物理处理方式,一边是剧烈搅拌,一边是长时间轻柔摇动(Hines et al., 2014[2];转引见 EMBO Journal 综述[3])。这个故事通常被当作“协议写得不够细”的教训来讲。但它同样说明,是两组人对“结果不一致”保持了足够长时间的不安,差异才被找到。

这就引出机制的核心。在自动化流程里,异常通常有两种去处:被统计流程当作离群值剔除,或者触发重跑,直到结果落回预期范围。两种处理都合理,也都高效。但它们共同的后果是,异常没有进入任何人的注意,也没有留下可回溯的记录。

两条反馈回路:手工流程中异常进入人的判断并修正方法;自动化流程中异常被记为噪声或重跑,回路不经过判断 手工流程回路 出现异常 人察觉 判断真假异常 修正方法 纠错能力被反复训练 自动化流程回路 出现异常 记为噪声 或直接重跑 无记录 回到起点 纠错机会不再出现
图 2 | 两条反馈回路:手工流程中异常进入人的判断并修正方法;自动化流程中异常被记为噪声或重跑,回路不经过判断 · 来源:一目半绘制

这里的差别不在效率,而在异常是否进入反馈。手工回路里,每一次异常都是一次判别训练:察觉、判断真伪、修正方法,判别能力因此被反复使用和强化。自动化回路里,这个训练的机会不再出现。久而久之,退化的不只是对某一次异常的识别,而是整个团队“察觉不对劲”的能力本身。

我把这个链条概括为“编码—滤除—纠错能力退化”:编码决定了什么被记录,未被记录的信号被滤除,被滤除的信号不再训练人的判别,判别能力于是逐渐弱化。需要说明,这是一个机制推演,而不是已经被测量的结论。我没有找到直接测量“实验室自动化程度”与“异常发现率”或“纠错能力”之间关系的实证研究。现有工作更多集中在相反方向,即如何让自动化系统自己识别执行异常,例如清华大学等团队 2025 年发布的自驱动实验室视觉异常数据集,关注的是机械臂抓取失败、物品缺失等操作层面的异常(Scientific Data, 2025[4])。这类工作很有价值,但它检测的是“流程有没有按协议执行”,而不是“结果是否暗示协议本身有问题”。

农业的先例:效率上去时,地方性知识可以一起流失

历史上有一个结构相似的过程。二十世纪中后期,农业机械化与高产品种推广在许多地区同时发生。人们长期担心,伴随这一过程的是地方品种被替代,以及围绕这些品种的选种、轮作、应对本地病虫害的地方知识一起流失。

这个担忧并非全无根据,但证据比通常讲述的更复杂。2022 年发表在 New Phytologist 上的一篇综述梳理了作物遗传侵蚀的证据,结论是:在农户田间的地方品种、现代栽培品种、作物野生近缘种和种质库中,都既观察到明显的流失,也观察到多样性的维持甚至增加,程度取决于物种、尺度、地区和分析方法(Khoury et al., 2022[5])。另一项 2010 年的荟萃分析汇总了 44 项研究、8 种大田作物,发现育种者释放品种的遗传多样性在 1960 年代比 1950 年代下降约 6%,但此后有所回升,长期看并没有出现大幅缩减(van de Wouw et al., 2010[6])。

所以,能从农业史上稳妥借用的,不是“机械化必然导致流失”这个因果结论,而是一个更弱也更有用的命题:效率提升与地方性知识的流失可以并行发生,而且流失往往不在效率指标里显示。产量统计不会告诉你一个村子里还有几个人会辨认某种地方品种的抗病性状。

这个类比有它的边界。相似之处在于:两者都是把分散在个人和地方的经验,替换为标准化的投入与流程;被替换掉的知识都依赖情境、难以文字化;流失都发生在主要指标之外。不相似之处同样重要:种质可以进入种子库保存,异常却很难事后补录;农业的目标相对单一,而实验科学同时追求“可重复”和“可发现”两个目标;农业知识的流失跨越几代人,实验室的判别能力退化可能只需要一两个博士周期。最后,类比只能提示一个机制可能存在,不能替代对实验室本身的测量。

AI 进入数学与实验科学:争论落在“验证”还是“发现”

最近几个月关于 AI 做科学的几件事,恰好让这个问题变得具体。

2026 年 9 月 11 日,一份关于数学与 AI 的联合声明在 mathandai.org[7] 发布。陶哲轩在社交账号上说明,最初有 25 位菲尔兹奖得主联署,并欢迎更多人加入(陶哲轩的说明[8]);声明页面目前列出的获奖者签名已多于这个数,且持续开放。声明没有呼吁禁令或监管,它的核心主张是:解题只是工具和代理指标,数学的首要目标是概念理解与洞见。其中一句话直接触及本文的问题:多年训练不仅产出最终答案,也培养理解力和提出新问题的能力。声明还担心,以越来越快的速度大批量生产“真/假”陈述,可能毁掉而非滋养新想法生长的土壤。

2026 年 9 月 1 日,Anthropic 披露其模型完成了平面 N=4 超对称杨-米尔斯理论中六粒子散射振幅的九圈计算,此前的纪录是 Lance Dixon 等人 2023 年的八圈(Anthropic 研究博客[9])。需要澄清,这是一项理论物理计算,而不是图论问题。据该文披露,结果由 SLAC 的 Dixon 核对;参与者也强调,模型使用的是已知的“自举”方法,而不是新的物理原理。正式论文将由人类合作者发表,截至本文写作时尚未见同行评议版本。

2026 年 9 月 23 日,Anthropic 又披露其模型代理在大规模序列数据库中筛查了二十余万个逆转录酶,提出一类与 CRISPR 结构相似、此前未被表征的系统,随后由人类科学者在实验室中表达蛋白并做了生化与结构表征(Anthropic 新闻稿[10])。这是公司披露,配套的是预印本,尚未经过同行评议;作者自己也写明,这个系统的功能尚不清楚。

把三件事放在一起看,争论的重心很清楚。九圈计算的价值几乎全在验证端:问题定义清楚,方法已知,答案可以被独立核对。酶系统的发现跨越了两端:计算部分负责在巨大空间里筛选候选,而“这是不是一个真实、有意义的新东西”,仍要回到湿实验和人的判断。菲尔兹奖得主们的声明则把矛头指向另一件事:当产出答案的速度远超理解答案的速度,训练判别力的过程本身可能被跳过。

这和实验室自动化的问题是同构的。AI 和自动化都极大地加速了“按既定标准产出可核对结果”这一端;而“察觉标准本身可能有问题”的能力,既不在它们的优化目标里,也正是人在重复劳动中被动训练出来的。

最强的反方:被滤掉的多半只是噪声

这个论点有一个必须正面回应的反方,而且它很强。

手工时代的“手感”同时也是不可重复误差的主要来源。2016 年 Nature 对 1576 名研究者的在线问卷显示,超过七成的受访者曾尝试复现他人实验而失败,超过一半曾无法复现自己的实验(Baker, Nature, 2016[11])。这项调查样本是自选的 Nature 读者,比例不能外推为“七成研究不可重复”,但它至少说明,依赖个人操作的实验体系本身充满难以追踪的变异。上面那个乳腺细胞的例子,换个角度看,恰好是手工差异制造不可重复性的教科书案例。

自动化在这里做了两件真正重要的事。一是剔除了大量噪声,让真正的信号更容易显现。二是让原本只存在于个人身上的知识开始变得可积累、可传授、可审计:一位技术员离职,手法不会随之消失;一条协议出了问题,可以逐步回溯。

反方还可以再推进一步:被滤除的“异常”里,绝大多数可能本来就只是噪声。真正有意义的异常极少,为了保留它们而容忍全部手工变异,代价未必划算。所谓“判别能力流失”,也许只是判断权从操作者转移到了流程设计者和仪器身上;设计者在制定容差、设定质控点时,正是在行使判别性知识。

我接受这个反方的大部分内容,并据此给本文的论点设定边界。论点不成立的条件是:自动化流程本身保留了对异常的低成本记录与回溯通道,并且最终的判断权仍掌握在具备判别能力的科学家手中。满足这两个条件时,编码未必导致纠错能力退化,反而可能因为记录更完整而让异常更容易被看见。

自动化本身不会削弱科学的纠错能力,削弱它的是一条不给异常留下记录、也不再需要人去判断异常的流程。

因此,与其说本文反对自动化,不如说它反对一种默认设计:把重跑当作异常的唯一出口,把离群值剔除当作质控的终点。

可重复与可发现:仍然开放的问题

把讨论收回来。“可重复”和“可发现”是两个不同的目标。前者要求压低方差,后者有时恰恰需要注意方差。自动化对前者几乎是纯收益,对后者的影响则取决于流程设计。

判断一条流程是否仍保有发现能力,可以看几个迹象。关键环节是否仍有人亲手操作,或至少有人定期亲眼看过原始样本与原始数据?异常结果是被记录、标注、定期复盘,还是被静默重跑?团队里是否还有人能说出“正常结果通常长什么样”,并解释为什么?如果这三个问题的答案都是否定的,那么流程可能已经在用可重复性换取发现能力,只是这笔交换不在任何指标里显示。

需要再次说明本文的局限。“编码—滤除—纠错能力退化”是一个机制推演,农业史只是类比,AI 相关的事件大多来自公司披露或尚未经过同行评议的工作。真正能检验这个判断的,是一类目前还很少见的研究:在自动化程度不同的实验室之间,比较异常被记录、被追查、最终被确认为新现象的比例。

还有几个问题仍然开放。

第一,编码的边界会不会随技术移动?多模态传感和视觉模型也许能把今天的“手感”变成明天的数据。如果是这样,判别性知识与操作性知识的界线就不是固定的,本文的拆分也只在特定技术条件下成立。

第二,流程中如何以足够低的成本保留异常通道?例如,每一次重跑都强制留下原始记录和一句人写的备注,代价不高,却可能保住一部分纠错机会。

第三,判别能力由谁训练、由谁继承?如果新一代研究者从入门起就只面对自动化流程,他们在哪里积累对“正常”的默会预期?这与菲尔兹奖得主们担心的问题是同一个:训练过程的价值,不只在它产出的答案。

要点

  1. 隐性知识分两层:可写成协议的操作性知识,与依赖情境的判别性知识;自动化主要编码前者。
  2. 风险不在效率,而在异常是否进入反馈:被记为噪声或静默重跑的异常,不再训练人的判别能力。
  3. 判断一条流程是否仍能发现新东西,看关键环节是否留人、异常是否被记录并由人复盘。

自动化不是中性的工具替换。它在决定什么值得被记录的同时,也决定了科学还能看见哪些异常。

参考资料

  1. https://orca.cardiff.ac.uk/id/eprint/90648/
  2. https://www.cell.com/cell-reports/fulltext/S2211-1247(14)00121-1
  3. https://link.springer.com/article/10.15252/embj.2018101011
  4. https://www.nature.com/articles/s41597-025-06060-y
  5. https://nph.onlinelibrary.wiley.com/doi/10.1111/nph.17733
  6. https://research.wur.nl/en/publications/genetic-diversity-trends-in-twentieth-century-crop-cultivars-a-me/
  7. https://mathandai.org/
  8. https://mathstodon.xyz/@tao/117253629967855195
  9. https://www.anthropic.com/research/yes-claude-can-do-nine-loops
  10. https://www.anthropic.com/news/claude-discovers-novel-enzyme-system
  11. https://www.nature.com/articles/533452a