中文

用于改进语音识别和音频事件分类的多模态注意力融合

机器学习 2024-02-12 v2 声音 音频与语音处理

摘要

使用在无标签数据上针对大型基础模型进行自监督目标训练,然后在下游任务上进行微调,已成为标准做法。不幸的是,这种方法的有效性常受限于有限的微调计算资源和稀缺的下游标签数据。我们引入了多模态注意力融合(MAM),一种尝试通过零样本范式将根植于高资源模态(文本和图像)的注意力矩阵中的知识,直接传输到资源受限领域(语音和音频)中的注意力矩阵。MAM可将自动语音识别(ASR)模型的相对词错误率(WER)降低最高可达6.70%,将音频事件分类(AEC)模型的相对分类错误率降低10.63%。在某些数据/计算资源可用的情况下,我们提出了可学习的MAM(Learnable-MAM),一种数据驱动的融合注意力矩阵的方法,相较于微调可进一步降低ASR的相对WER降低2.90%,AEC的相对分类错误率降低18.42%。

关键词

引用

@article{arxiv.2312.14378,
  title  = {Multimodal Attention Merging for Improved Speech Recognition and Audio Event Classification},
  author = {Anirudh S. Sundar and Chao-Han Huck Yang and David M. Chan and Shalini Ghosh and Venkatesh Ravichandran and Phani Sankar Nidadavolu},
  journal= {arXiv preprint arXiv:2312.14378},
  year   = {2024}
}

备注

5 pages, 1 figure, ICASSP 2024 Workshop on Self-supervision in Audio, Speech and Beyond