长序列模型能否有效建模长序列?比较架构归纳偏置对长情境能力的影响
机器学习
2025-05-23 v3 人工智能
计算与语言
摘要
长序列在现实场景中屡见不鲜,因此正确建模它们开辟了诸多下游应用场景。然而,深度神经网络常常在这方面困难重重。近期在系统工程和模型设计方面的进展,使能够扩展支持更长上下文长度的模型成为可能。特别是,状态空间和线性循环神经网络家族的模型理论上可以延伸至无限序列长度。然而,这是否过于理想化?我们进行评估,表明虽然这些说法在理论上可能成立,但仍存在大量实践差距。具体而言,循环模型在与长情境LLM相同的情况下仍面临挑战。我们进一步表明,不同的归纳偏置在外推能力上表现不一致,这凸显了进一步研究此类范式并探讨为何长情境模型似乎未能如预期般表现的必要性。
引用
@article{arxiv.2407.08112,
title = {How Well Can a Long Sequence Model Model Long Sequences? Comparing Architechtural Inductive Biases on Long-Context Abilities},
author = {Jerry Huang},
journal= {arXiv preprint arXiv:2407.08112},
year = {2025}
}
备注
Accepted to The 31st International Conference on Computational Linguistics (COLING), 2025