中文

论长程竞技场中的局部偏置及其结果

计算与语言 2025-01-28 v1 人工智能

摘要

长程竞技场 (LRA) 基准测试旨在评估 Transformer 改进及其替代方案在长程依赖建模任务中的性能。Transformer 及其主要变体在该基准测试上表现不佳,State Space Models (SSMs) 等新型架构获得了一定热度,在 LRA 中表现显著优于 Transformer。近期研究表明,经过去噪预训练后,Transformer 能够在这些新型架构中取得与之相当的成绩。本文讨论并阐述了 MEGA 等架构在长程竞技场中的优势,以及 Transformer 最近性能提升的现象,指出这些任务的positional和局部特性。我们展示,尽管 LRA 是长程依赖建模的基准测试,但实际上大部分性能来自短程依赖。通过训练技术缓解数据效率不足,Transformer 能够通过proper positional encoding 实现最佳性能。此外,采用相同技术,我们能够消除 SSM 卷积核的所有限制,学习完全参数化的卷积而不降低性能,这表明 SSM 的设计选择仅为这些特定任务添加了归纳偏置和学习效率。我们的见解表明,LRA 结果应谨慎解读,并呼吁对基准进行重新设计。

关键词

引用

@article{arxiv.2501.14850,
  title  = {On the locality bias and results in the Long Range Arena},
  author = {Pablo Miralles-González and Javier Huertas-Tato and Alejandro Martín and David Camacho},
  journal= {arXiv preprint arXiv:2501.14850},
  year   = {2025}
}