中文

信号就在步骤中:用于推理数据选择的局部评分

机器学习 2026-04-16 v2 人工智能

摘要

从教师模型提炼长形式推理到较小的学生模型,需要选择哪些候选解才能进行训练。最近的工作认为,应选择学生模型赋予最高概率的响应,即倾向于选择“自然”符合学生的解答。然而,我们发现,这种方法在单个教师内部有效,但当扩展到来自多个 diverse 教师的长推理痕迹时便失效。我们识别出关键原因:该方法对整个解答进行评分,但学生是通过重新组合熟悉的推理步骤来泛化,而非记忆完整的解答。完整轨迹评分优化了错误的目标;它奖励的是全局流畅度,而可迁移的信号存在于局部步骤转换中。我们提出了局部平均对数概率(Local Average Log Probability, LALP),该方法仅使用小范围前导上下文对每个推理步骤进行评分,衡量该步骤是否由其immediate 前提所正当化,而非整个响应是否对学生而言“自然”。LALP 实现了两个实际用例:在微调前选择最佳教师,以及从 diverse 教师池中精选训练数据。在数学、编程和科学推理任务中,LALP 在选择最“自然”解答时始终能显著提高准确率。

关键词

引用

@article{arxiv.2510.03988,
  title  = {The Signal is in the Steps: Local Scoring for Reasoning Data Selection},
  author = {Hoang Anh Just and Myeongseob Ko and Ruoxi Jia},
  journal= {arXiv preprint arXiv:2510.03988},
  year   = {2026}
}

备注

Preprint