中文

与输入无关的注意力权重已具足够表达能力:自监督音频 Transformer 中的注意力研究

音频与语音处理 2020-11-04 v2 计算与语言 声音

摘要

本文寻求降低基于 transformer 的语音表征学习模型计算复杂度的方案。我们评估了 10 种注意力算法;随后以自监督方式用这些注意力算法预训练基于 transformer 的模型,并将其作为下游任务(包括音素分类与说话人分类)的特征提取器。借助 t-SNE、PCA 及若干观察,自监督音频 transformer 中的注意力权重可归为四种一般情形。基于这些情形与分析,我们得以使用一组特定的注意力权重来初始化模型。我们的方法展现出与典型自注意力相当的性能,却在训练与推理中均少耗时 20%。

关键词

引用

@article{arxiv.2006.05174,
  title  = {Input-independent Attention Weights Are Expressive Enough: A Study of Attention in Self-supervised Audio Transformers},
  author = {Tsung-Han Wu and Chun-Chen Hsieh and Yen-Hao Chen and Po-Han Chi and Hung-yi Lee},
  journal= {arXiv preprint arXiv:2006.05174},
  year   = {2020}
}