Transformer 的捷径解削害连续组合推理
机器学习
2026-05-08 v1
摘要
识别和利用跨域的共同特征是人类进行类比推理的核心能力,也被认为是持续学习能力的关键。为此,需要发展出通用且灵活的计算策略。虽然 Transformer 神经网络模型在执行组合推理方面的能力是近期大力研究的焦点,但对这些模型如何充分利用表示学习以适应新相关经验的系统性理解仍寡言少有。为填补这一空白,我们将之前开发的学习等价与群操作(LEGO)框架扩展到持续学习(CL)设置中("continual LEGO")。使用此持续 LEGO 实验范式,我们研究了前馈和循环 Transformer 模型进行 CL 的能力。我们发现 BERT——一种典型的前馈 Transformer 模型——学习了限制其泛化能力并阻止对新经验进行强前向迁移的捷径解。相比之下,我们发现 ALBERT——BERT 的循环版本——学习了类似 For 循环的解,导致更好的 CL 性能。当将 BERT 和 ALBERT 模型应用于需要跨经验组合的 CL 设置时,我们发现两类模型都失败了。我们的研究表明,ALBERT 模型可通过结合跨经验数据的数据训练策略来恢复其性能,而 BERT 模型则不行,其中学习的捷径解会随初始训练而根深蒂固。我们的结果表明,循环 ALBERT 模型可能具有更适合 CL 的归纳偏置,并激励对 Transformer 架构与现代模型和任务中所涌现的计算解决方案之间相互作用的进一步研究。
关键词
引用
@article{arxiv.2605.05495,
title = {Shortcut Solutions Learned by Transformers Impair Continual Compositional Reasoning},
author = {William T. Redman and Erik C. Johnson and Brian Robinson},
journal= {arXiv preprint arXiv:2605.05495},
year = {2026}
}
备注
17 pages, 6 figures