合成错误注入未能诱发语言模型的自我纠正能力
人工智能
2025-12-03 v1 机器学习
摘要
强化学习已成为激发大型语言模型推理和自我纠正能力的主导范式,但其计算成本促使探索替代方案。受自主驾驶和机器人技术的启发,我们调查监督学习配合合成错误注入是否能在语言模型中诱导自我纠正能力。我们的方法将人工错误插入推理链中,遮盖它们,并监督模型识别和纠正这些错误。尽管这种方法具有直观的吸引力,我们发现即使在多个模型上进行简单合成任务测试,也未显著提升性能。此外,,即使模型捕获其自身的错误,也常常复述原始错误。我们发现,合成错误到策略错误的分布迁移显著降低了精调模型的错误纠正能力,即使合成覆盖率良好。我们的结果帮助解释了为何策略性强化学习方法在激发自我纠正方面独特有效。
引用
@article{arxiv.2512.02389,
title = {Synthetic Error Injection Fails to Elicit Self-Correction In Language Models},
author = {David X. Wu and Shreyas Kapur and Anant Sahai and Stuart Russell},
journal= {arXiv preprint arXiv:2512.02389},
year = {2025}
}
备注
13 pages, 12 figures