中文

从多个思考者那里学习如何思考

机器学习 2026-04-28 v1 人工智能 计算复杂性 机器学习

摘要

我们研究使用来自多个思考者的链路思考 (Chain-of-Thought, CoT) 监督学习,其中所有人都提供正确但可能系统性不同的解决方案,例如由不同的思考者撰写的针对数学问题的逐步解决方案,或是由解决相同问题的不同程序的逐步执行痕迹。我们考虑那些在单个思考者的 CoT 监督下容易学习,但仅凭 end-result 监督(即没有 CoT)就难以学习的类(Joshi 等 2025)。我们证明,在密码学假设下,从两个或少数几个不同思考者提供的 CoT 监督进行学习可能是困难的,在被动数据收集设置下。另一方面,我们提供了一个通用的计算高效主动学习算法,该算法能够以每个思考者少量的 CoT 数据学习,这些数据完全独立于目标准确率 ε\varepsilon,需要中等数量的思考者,规模为 log1εloglog1ε\log \frac{1}{\varepsilon}\log \log \frac{1}{\varepsilon},以及规模为 1εpolylog1ε\frac{1}{\varepsilon}\cdot poly\log\frac{1}{\varepsilon} 的足够被动 end-result 数据。

关键词

引用

@article{arxiv.2604.24737,
  title  = {Learning to Think from Multiple Thinkers},
  author = {Nirmit Joshi and Roey Magen and Nathan Srebro and Nikolaos Tsilivis and Gal Vardi},
  journal= {arXiv preprint arXiv:2604.24737},
  year   = {2026}
}

备注

Comments are welcome. There are 78 pages and 5 Figures