从多个思考者那里学习如何思考
机器学习
2026-04-28 v1 人工智能
计算复杂性
机器学习
摘要
我们研究使用来自多个思考者的链路思考 (Chain-of-Thought, CoT) 监督学习,其中所有人都提供正确但可能系统性不同的解决方案,例如由不同的思考者撰写的针对数学问题的逐步解决方案,或是由解决相同问题的不同程序的逐步执行痕迹。我们考虑那些在单个思考者的 CoT 监督下容易学习,但仅凭 end-result 监督(即没有 CoT)就难以学习的类(Joshi 等 2025)。我们证明,在密码学假设下,从两个或少数几个不同思考者提供的 CoT 监督进行学习可能是困难的,在被动数据收集设置下。另一方面,我们提供了一个通用的计算高效主动学习算法,该算法能够以每个思考者少量的 CoT 数据学习,这些数据完全独立于目标准确率 ,需要中等数量的思考者,规模为 ,以及规模为 的足够被动 end-result 数据。
引用
@article{arxiv.2604.24737,
title = {Learning to Think from Multiple Thinkers},
author = {Nirmit Joshi and Roey Magen and Nathan Srebro and Nikolaos Tsilivis and Gal Vardi},
journal= {arXiv preprint arXiv:2604.24737},
year = {2026}
}
备注
Comments are welcome. There are 78 pages and 5 Figures