AtManRL:通过可微注意力灵敏度实现可靠推理
计算与语言
2026-04-20 v1 人工智能
机器学习
摘要
大型语言模型(LLM)越来越依赖链式思维(CoT)推理以解决复杂任务。然而,确保推理轨迹既有助于又忠实地反映模型最终答案背后过程,而非仅附带其后,仍具有挑战性。我们引入 AtManRL,一种方法通过可微注意力操控来通过强化学习学习更可靠的推理。通过训练一个加法注意力掩码,以识别产生正确答案关键的 CoT 中的标记,我们派生出一种灵敏度奖励信号,以鼓励模型生成真正影响其最终预测的推理轨迹。我们将此灵敏度奖励与基于结果的奖励集成于 GRPO 框架中,以联合优化正确性和可解释性。在 Llama-3.2-3B-Instruct 上的 GSM8K 和 MMLU 实验表明,我们的方法能够识别具有影响力的推理标记,并 enables训练更透明的推理模型。
引用
@article{arxiv.2604.16158,
title = {AtManRL: Towards Faithful Reasoning via Differentiable Attention Saliency},
author = {Max Henning Höth and Kristian Kersting and Björn Deiseroth and Letitia Parcalabescu},
journal= {arXiv preprint arXiv:2604.16158},
year = {2026}
}
备注
14 pages, 8 figures, 1 table