中文

OpenSR:通过保持多模态对齐的开放模态语音识别

计算与语言 2023-06-13 v1 计算机视觉与模式识别

摘要

语音识别在多媒体流(仅音频、仅视觉或音视觉)与相应文本转录之间架起桥梁。然而,在训练新领域的特定模型时,常陷入缺乏新领域话语的困境,尤其是带标签的视觉话语。为突破此限制,我们尝试通过在预训练期间利用高资源领域未标记多媒体话语在音素空间中学到的多模态对齐,实现零样本模态迁移(shi2022learning),并提出一种训练系统开放模态语音识别(\textbf{OpenSR}),使在单一模态(如仅音频)上训练的模型适用于更多模态(如仅视觉和音视觉)。此外,我们采用基于聚类的提示调优策略,以处理新领域话语中仅含常见词的场景的领域偏移。我们证明OpenSR在三种不同设置(零样本、少样本和全样本)下实现从一种模态到任意模态的迁移,并与现有少样本和全样本唇读方法相比取得极具竞争力的零样本性能。据我们所知,OpenSR在LRS2的音视觉语音识别和唇读上分别以2.7%和25.0%的词错率取得了最先进性能。代码和演示可在 https://github.com/Exgc/OpenSR 获取。

关键词

引用

@article{arxiv.2306.06410,
  title  = {OpenSR: Open-Modality Speech Recognition via Maintaining Multi-Modality Alignment},
  author = {Xize Cheng and Tao Jin and Linjun Li and Wang Lin and Xinyu Duan and Zhou Zhao},
  journal= {arXiv preprint arXiv:2306.06410},
  year   = {2023}
}

备注

Accepted to ACL2023 (Oral)