中文

利用注意力机制:基于注意力自编码器的序列高效约简

机器学习 2023-10-24 v1 人工智能

摘要

许多机器学习模型将维度操作作为驱动模型识别和学习数据中重要特征的力量。对于序列数据,这种操作通常发生在 token 维度层面。尽管许多任务需要改变序列长度本身,序列长度约简步骤通常出于必要且以单步完成。据我们所知,尚无模型将序列长度约简步骤用作调优模型性能的额外机会。事实上,序列长度操作作为一个整体似乎是一个被忽视的方向。在本研究中,我们引入一种新颖的基于注意力的方法,允许直接操作序列长度。为探索该方法的能力,我们将其用于自编码器模型中。该自编码器将输入序列约简为潜空间中更小的序列,然后旨在从该约简形式重建原始序列。在此设定下,我们探究该方法针对不同输入与潜空间序列长度的约简性能。我们能够表明,当将原始序列约简至其原始大小的一半时,自编码器保留了所有显著信息。当约简至低至原始大小的四分之一时,自编码器仍能以约 90% 的准确率重建原始序列。

关键词

引用

@article{arxiv.2310.14837,
  title  = {Harnessing Attention Mechanisms: Efficient Sequence Reduction using Attention-based Autoencoders},
  author = {Daniel Biermann and Fabrizio Palumbo and Morten Goodwin and Ole-Christoffer Granmo},
  journal= {arXiv preprint arXiv:2310.14837},
  year   = {2023}
}

备注

8 pages, 5 images, 1 table