到底什么才重要?探究多语言 CoT 推理中的步骤级和标记级归因
计算与语言
2025-11-21 v1
摘要
本研究探讨了链式思维 (CoT) 推理在多语言大语言模型中所反映的归因模式。尽管先前的研究表明 CoT 提示在提升任务性能方面发挥着作用,但关于生成推理链的忠诚性和可解释性仍存疑虑。为评估这些属性在不同语言中的表现,我们对 Qwen2.5 1.5B-Instruct 模型应用两种互补的归因方法——用于步骤级归因的 ContextCite 和用于标记级归因的 Inseq,使用 MGSM 数据集进行测试。我们的实验结果揭示了若干关键发现:(1) 归因得分在错误生成中过度强调最终推理步骤,尤其在多语言情境下;(2) 结构化 CoT 提示主要针对高资源拉丁字符语言显著提升准确率;(3) 通过否定和干扰句子进行受控扰动会降低模型准确率并削弱归因一致性。这些发现凸显了 CoT 提示在多语言鲁棒性和解释透明性方面的局限性。
引用
@article{arxiv.2511.15886,
title = {What Really Counts? Examining Step and Token Level Attribution in Multilingual CoT Reasoning},
author = {Jeremias Ferrao and Ezgi Basar and Khondoker Ittehadul Islam and Mahrokh Hassani},
journal= {arXiv preprint arXiv:2511.15886},
year = {2025}
}
备注
Received the Best Student Project Award at RuG's Advanced-NLP course