面对有害后期 LLM 数学推理的受保护修复
计算与语言
2026-05-26 v1 人工智能
软件工程
摘要
后期修复大语言模型 (LLM) 的数学推理引入了非对称风险:修复错误的推理轨迹有用,但替换已经正确的推理轨迹可能造成伤害。我们在选择性替换设置下研究此问题,在此设置下,系统必须决定修复后的备选解是否比保留原始缓存推理轨迹更安全。我们提出了 GuardedRepair——一种受保护的最佳-N 修复框架,该框架诊断缓存的推理轨迹,选择性地触发修复,仅当确定性验证守卫支持替换时才接受会改变答案的备选解。该框架结合了轻量级符号检查、表面语义风险诊断、受限的备选生成以及保守的接受策略。在完整的 GSM8K 测试集上,其中初始推理器已实现 95.60% 的准确率,GuardedRepair 将最终准确率提升至 96.89%,修复了 58 个剩余错误中的 17 个,且在主运行中未测量到破坏正确答案的案例。在弱推理器的 ASDiv 设置下,准确率从 78.40% 提升至 87.60%。直接再生基线显示,这一提升并非仅因更强模型重新求解所致:重新生成所有 GSM8K 示例后,准确率降至 93.03%,并破坏了 47 个最初正确的答案。额外分析表明,受保护修复在固定/破坏权衡方面显著改善了该权衡,同时也揭示了替换风险而非消除。这些结果支持将后期修复视为以有害感知的选择性替换,而非无限制的重新求解。
引用
@article{arxiv.2605.24613,
title = {Guarded Repair for Harm-Aware Post-hoc Replacement of LLM Mathematical Reasoning},
author = {Haizhou Xia},
journal= {arXiv preprint arXiv:2605.24613},
year = {2026}
}
备注
15 pages,including appendices. Code and artifacts available at https://github.com/Haizhoux0517/guarded-repair