中文

XNOR-FORMER:在长语音 Transformer 中学习精确近似

计算与语言 2022-12-21 v2 人工智能 声音 音频与语音处理

摘要

Transformer 在语音、视觉和自然语言处理等众多任务中处于最先进水平。自注意力是其性能的关键贡献者,但具有二次计算复杂度,这使得在更长输入序列上的训练颇具挑战。已有工作提出了具有线性注意力的先进 Transformer 变体,然而当前模型为实现高效实现而牺牲了性能。在本工作中,我们通过考察自注意力内部键-查询乘积的性质,开发了一种新颖的线性 Transformer。我们的模型在语音识别与语音摘要上优于最先进方法,在 Librispeech-100 语音识别基准和新提出的 INTERVIEW 语音识别基准上取得了 1% 的绝对 WER 提升,并在 How2 的摘要任务上取得 5 个 ROUGE 点的提升。

关键词

引用

@article{arxiv.2210.16643,
  title  = {XNOR-FORMER: Learning Accurate Approximations in Long Speech Transformers},
  author = {Roshan Sharma and Bhiksha Raj},
  journal= {arXiv preprint arXiv:2210.16643},
  year   = {2022}
}

备注

Under review at ICASSP 2023