中文

理解自监督音频 Transformer 的自注意力机制

计算与语言 2020-08-12 v2

摘要

自监督音频 Transformer(SAT)在许多下游语音应用(如 ASR)中取得巨大成功,但其工作机制尚未被广泛探究。本工作中,我们提出多种用于分析 SAT 中注意力机制的策略。我们将注意力归类为可解释的类别,并发现每一类具备其独特功能。我们提供用于理解多头自注意力的可视化工具、识别关键注意力的的重要性排序策略,以及提升模型性能的注意力精炼技术。

关键词

引用

@article{arxiv.2006.03265,
  title  = {Understanding Self-Attention of Self-Supervised Audio Transformers},
  author = {Shu-wen Yang and Andy T. Liu and Hung-yi Lee},
  journal= {arXiv preprint arXiv:2006.03265},
  year   = {2020}
}

备注

Accepted by INTERSPEECH 2020, ICML 2020 Workshop on Self-supervision in Audio and Speech