后见之明提示蒸馏:从无思维链答案中为 SWE 智能体构建支架式推理
人工智能
2026-05-13 v1 机器学习
摘要
解决复杂的长期任务需要强大的规划和推理能力。尽管带有显式思维链(CoT)理由的数据集可以极大地有益于学习,但获取成本高昂。为了应对这一挑战,我们提出了后见之明提示蒸馏(HHD),它只需要易于获取的问答对,无需 CoT 标注。受人类教师如何利用学生错误提供针对性指导的启发,HHD 从模型自身失败的自我推演中合成后见之明提示,并利用它们来支撑成功完成任务的在线策略推演。然后,模型自我蒸馏这些支架式轨迹,并在没有提示指导的情况下泛化到新问题。实验表明,HHD 显著优于迭代 RFT 和轨迹合成基线,在 SWE-bench Verified 上实现了 8% 的绝对提升,而所有基线仅提升约 2%。值得注意的是,HHD 诱导的推理策略能有效泛化到分布外任务,在 SWE-bench Multilingual 上取得了最大增益,尽管没有在多语言数据上进行训练。这些结果表明,HHD 能够有效地从无 CoT 数据中合成专家级推理,并显著提升长期性能。
引用
@article{arxiv.2605.11556,
title = {Hindsight Hint Distillation: Scaffolded Reasoning for SWE Agents from CoT-free Answers},
author = {Shengjie Wang and Guanghe Li and Zonghan Yang and Yang Gao},
journal= {arXiv preprint arXiv:2605.11556},
year = {2026}
}
备注
28 pages, 7 figures