XNOR-FORMER:在长语音 Transformer 中学习精确近似
计算与语言
2022-12-21 v2 人工智能
声音
音频与语音处理
摘要
Transformer 在语音、视觉和自然语言处理等众多任务中处于最先进水平。自注意力是其性能的关键贡献者,但具有二次计算复杂度,这使得在更长输入序列上的训练颇具挑战。已有工作提出了具有线性注意力的先进 Transformer 变体,然而当前模型为实现高效实现而牺牲了性能。在本工作中,我们通过考察自注意力内部键-查询乘积的性质,开发了一种新颖的线性 Transformer。我们的模型在语音识别与语音摘要上优于最先进方法,在 Librispeech-100 语音识别基准和新提出的 INTERVIEW 语音识别基准上取得了 1% 的绝对 WER 提升,并在 How2 的摘要任务上取得 5 个 ROUGE 点的提升。
引用
@article{arxiv.2210.16643,
title = {XNOR-FORMER: Learning Accurate Approximations in Long Speech Transformers},
author = {Roshan Sharma and Bhiksha Raj},
journal= {arXiv preprint arXiv:2210.16643},
year = {2022}
}
备注
Under review at ICASSP 2023