中文

延迟注意力训练改进Transformer--RNN 混合模型的长度泛化

机器学习 2025-10-02 v1

摘要

我们研究了序列模型在包含状态跟踪和关联记忆的复合问题上的长度泛化。先前的工作发现,循环网络在处理状态跟踪方面表现良好,但在记忆方面存在挑战,而Transformer在记忆方面表现出色,却无法将状态跟踪能力扩展到更长的序列。以这些架构的互补优势为动机,我们构建了集成循环和注意力机制组件的混合模型,并在组合任务上进行训练,以评估是否可以保留两种能力。我们的结果揭示,在此类混合模型中,Transformer组件倾向于利用捷径解决方案,导致长度泛化表现不佳。我们识别出这种捷径依赖是关键障碍,并提出一种简单而有效的训练策略——延迟注意力层的训练——以缓解此效果,从而显著提高长度泛化性能。我们的实验表明,这一方法使混合模型能够在训练时使用的序列长度三倍的混合序列上实现接近完美的准确率(>90%)。

关键词

引用

@article{arxiv.2510.00258,
  title  = {Delayed Attention Training Improves Length Generalization in Transformer--RNN Hybrids},
  author = {Buu Phan and Reza Ebrahimi and Sanjay Haresh and Roland Memisevic},
  journal= {arXiv preprint arXiv:2510.00258},
  year   = {2025}
}