哪些推理轨迹能教导学生更好地推理?关于信息性对齐的简单度量
计算与语言
2026-05-26 v5
摘要
长链的思维(CoT)轨迹为从教师到学生LLM提供丰富的推理信号。然而,prior work和我们的实验表明,来自更强教师的轨迹并不一定产生更好的学生,这凸显了数据-学生适应性的重要性。现有方法通过学生概率评估适当性,优先于与学生模型当前行为高度一致的轨迹,但忽略了更具信息性的轨迹。为此,我们提出Rank-Surprisal Ratio(RSR),一种简单度量,捕捉对齐性和信息性,以评估推理轨迹的适当性。RSR的动机是观察到有效轨迹通常通过结合低绝对概率和相对较高排名下的标记来平衡学习信号强度和行为对齐。具体而言,RSR定义为轨迹平均标记级排名与其平均负对数似然率之比,计算和解释都很简单。在五个学生模型和来自11个多样化教师的推理轨迹上,RSR与训练后推理性能强相关(平均Spearman 0.86),持续优于现有度量。我们进一步演示了其在轨迹选择和教师选择中的实际用途。
关键词
引用
@article{arxiv.2601.14249,
title = {Which Reasoning Trajectories Teach Students to Reason Better? A Simple Metric of Informative Alignment},
author = {Yuming Yang and Mingyoung Lai and Wanxu Zhao and Xiaoran Fan and Zhiheng Xi and Mingqi Wu and Chiyue Huang and Jun Zhao and Haijun Lv and Jian Tong and Yunhua Zhou and Yicheng Zou and Qipeng Guo and Tao Gui and Qi Zhang and Xuanjing Huang},
journal= {arXiv preprint arXiv:2601.14249},
year = {2026}
}
备注
Accepted to ACL 2026 (Main Conference). 31 pages. Project page: https://github.com/UmeanNever/RankSurprisalRatio