将推理计算用作教师:无参考监督的推理计算转化
机器学习
2026-05-12 v3
摘要
当后训练中不存在真实答案时,学习信号从何而来?我们表明,推理计算本身可以作为监督信号。通过生成平行 rollout 并将其转换为参考估计,模型可以在没有人工标签的情况下学习——这在像医疗指导这样不可验证的领域尤为重要,此时不存在程序化检查器。我们称这个框架为 计算作教师(CaT),它将推理时间的平行 rollout 计算转化为监督信号,用于 RL 训练。该框架包含两个组件:(1)参考估计,它聚合 rollout 以生成伪参考答案,(2)奖励推导,它将该伪参考转换为 RL 奖励。对于 (1),我们探讨一种称为合成的方法,但该框架允许使用任何聚合器。对于 (2),我们引入自提出的评分标准,用于不可验证的领域。这些是由伪参考生成的二元、可审计准则,由 LLM 判官评分。在 HealthBench 上,使用 CaT 训练的模型在使用 9 倍更少的测试时间计算的情况下,匹配或超过推理时间聚合质量。此处,CaT 还能与来自专家医生注释的学习相抗衡,实现最初策略相比最高可达 +30% 的相对提升。该框架自然扩展到可验证奖励,在测试时间 RL 中的 MATH-500 上匹配现有最佳基准,显示出在两种类型领域中“即插即用”的多样性。
关键词
引用
@article{arxiv.2509.14234,
title = {Compute as Teacher: Turning Inference Compute Into Reference-Free Supervision},
author = {Dulhan Jayalath and Shashwat Goel and Thomas Foster and Parag Jain and Suchin Gururangan and Cheng Zhang and Anirudh Goyal and Alan Schelten},
journal= {arXiv preprint arXiv:2509.14234},
year = {2026}
}
备注
Published as a conference paper at ICML 2026. 23 pages, 6 figures, 12 tables