中文

掩码音频文本编码器是有效的多模态重打分器

声音 2023-05-26 v2 计算与语言 机器学习

摘要

掩码语言模型(MLM)已被证明在自动语音识别(ASR)系统的二遍重打分中是有效的。在本工作中,我们提出掩码音频文本编码器(MATE),一种将声学表示纳入 MLM 输入空间的多模态掩码语言模型重打分器。我们采用对比学习通过学习的共享表示来有效对齐模态。我们表明,在目标域数据不可用时,使用多模态重打分器有利于 ASR 系统的领域泛化。与仅文本基线相比,MATE 在域内数据集上降低词错误率(WER)4%–16%,在域外数据集上降低 3%–7%。此外,在极少量训练数据(0.8 小时)下,MATE 相比第一遍基线实现了 8%–23% 的 WER 降低。

关键词

引用

@article{arxiv.2305.07677,
  title  = {Masked Audio Text Encoders are Effective Multi-Modal Rescorers},
  author = {Jinglun Cai and Monica Sunkara and Xilai Li and Anshu Bhatia and Xiao Pan and Sravan Bodapati},
  journal= {arXiv preprint arXiv:2305.07677},
  year   = {2023}
}