中文

RNNs 尚未成为 Transformer(但正在逼近):关于 In-context 检索的关键瓶颈

机器学习 2024-12-10 v4 计算与语言 机器学习

摘要

本文探讨了循环神经网络(RNNs)和 Transformer 在解决算法问题中的表示能力差距。我们专注于理解 RNN(因其在处理长序列方面具有内存效率)是否能够匹配 Transformer 的性能,尤其是当 Transformer 增强了链路思维(Chain-of-Thought, CoT)提示后。我们的理论分析表明,CoT 能改善 RNN 的性能,但尚不足以弥合与 Transformer 的差距。一个关键瓶颈在于,即使采用 CoT,RNN 也无法从上下文中完美检索信息:对于若干需要显式或隐式要求此能力的任务,如关联记忆和确定图是否为树, 我们证明 RNN 的表达能力不足以解决这些问题,而 Transformer 可以轻松解决。相反,我们证明,通过采用增强 RNN 内在上下文检索能力的技术,包括检索增强生成(Retrieval-Augmented Generation, RAG)和添加单个 Transformer 层, 可以使 RNN 能够在 CoT 下解决所有可多项式时间解决的问题,从而弥合与 Transformer 的表示差距。

关键词

引用

@article{arxiv.2402.18510,
  title  = {RNNs are not Transformers (Yet): The Key Bottleneck on In-context Retrieval},
  author = {Kaiyue Wen and Xingyu Dang and Kaifeng Lyu},
  journal= {arXiv preprint arXiv:2402.18510},
  year   = {2024}
}

备注

42 pages, 6 figures