中文

面向内存高效Transformer的分组自注意力机制

机器学习 2022-10-07 v2 人工智能

摘要

时间序列数据分析十分重要,因为众多真实世界任务(如天气预报、电力消耗和股票市场预测)都涉及对随时间变化的数据进行预测。由于其周期特性和随时间的长程依赖,时间序列数据通常以长序列形式在较长观测期内记录。因此,捕获长程依赖是时间序列数据预测的重要因素。为解决这些问题,我们提出了两个新颖模块:分组自注意力(GSA)和压缩交叉注意力(CCA)。借助这两个模块,在较小超参数限制下,我们以序列长度ll实现了阶数为O(l)O(l)的计算空间和时间复杂度,并能在考虑全局信息的同时捕获局部性。在时序数据集上进行的实验结果表明,我们所提模型有效降低了计算复杂度,且性能与现有方法相当或更优。

关键词

引用

@article{arxiv.2210.00440,
  title  = {Grouped self-attention mechanism for a memory-efficient Transformer},
  author = {Bumjun Jung and Yusuke Mukuta and Tatsuya Harada},
  journal= {arXiv preprint arXiv:2210.00440},
  year   = {2022}
}

备注

10 pages, 3 figures, under review as a conference paper at ICLR 2023