中文

VHASR:一种基于视觉热词的多模态语音识别系统

声音 2024-10-08 v2 计算与语言 音频与语音处理

摘要

图像基准多模态自动语音识别(ASR)模型通过融合与语音相关的图像来增强语音识别性能。但一些研究表明,引入图像信息并不能提高 ASR 性能。本文提出了一种有效利用语音相关图像信息的新方法,构建 VHASR——一个将视觉作为热词以强化模型语音识别能力的多模态语音识别系统。我们的系统采用双流架构,分别对两个流进行文本转录,然后组合输出。我们在四个数据集上评估了所提出的模型:Flickr8k、ADE20k、COCO 和 OpenImages。实验结果表明,VHASR 可以有效利用图像中的关键信息来增强模型的语音识别能力。其性能不仅超越单模态 ASR,而且在现有基于图像的多模态 ASR 中实现了 SOTA。

关键词

引用

@article{arxiv.2410.00822,
  title  = {VHASR: A Multimodal Speech Recognition System With Vision Hotwords},
  author = {Jiliang Hu and Zuchao Li and Ping Wang and Haojun Ai and Lefei Zhang and Hai Zhao},
  journal= {arXiv preprint arXiv:2410.00822},
  year   = {2024}
}

备注

14 pages, 6 figures, accepted by EMNLP 2024