大型推理模型的解释能否泛化?
计算与语言
2026-01-19 v1 人工智能
摘要
大型推理模型 (LRM) 在解决问题的过程中会产生文本思维链 (CoT),它通过呈现人类可读的自然语言解释,成为理解问题的潜在强大工具。然而,目前尚不清楚这些解释是否具有泛化能力,即它们是否捕捉了关于底层问题的通用规律,而非 LRM 特有的晦涩规律。这对于理解或发现新概念(例如在 AI for science 领域)是一个至关重要的问题。我们通过评估一种特定的泛化性概念来研究这一泛化问题:一个 LRM 产生的解释在提供给其他 LRM 时,是否会引发相同的行为。我们发现,CoT 解释通常表现出这种泛化形式(即它们提高了 LRM 之间的一致性),并且这种增强的泛化与人类偏好排序和强化学习后训练相关。我们进一步分析了解释产生一致答案的条件,并提出了一种直接的句子级集成策略以提高一致性。综上所述,这些结果建议在使用 LRM 解释以获得新见解时需谨慎,并概述了表征 LRM 解释泛化能力的框架。
引用
@article{arxiv.2601.11517,
title = {Do explanations generalize across large reasoning models?},
author = {Koyena Pal and David Bau and Chandan Singh},
journal= {arXiv preprint arXiv:2601.11517},
year = {2026}
}