OCR 增强的多模态 ASR 能边听边读
声音
2026-01-27 v1 计算与语言
音频与语音处理
摘要
视觉信息(例如电影中的字幕)通常有助于自动语音识别。在本文中,我们提出了 Donut-Whisper,一种带有双编码器的音视频 ASR 模型,以利用视觉信息来提高英语和中文的语音识别性能。Donut-Whisper 通过交叉注意力模块结合了线性和基于 Q-Former 的模态对齐结构的优势,生成更强大的音视频特征。同时,我们提出了一种轻量级知识蒸馏方案,展示了使用音视频模型来教授纯音频模型以实现更好性能的潜力。此外,我们提出了一个新的基于包含中英分区的电影片段的多语言音视频语音识别数据集。因此,与 Donut 和 Whisper large V3 基线相比,Donut-Whisper 在数据集的英语和中文分区上均取得了显著更好的性能。特别地,与 Whisper ASR 基线相比,在英语和中文集上分别实现了绝对 5.75% 的 WER 降低和绝对 16.5% 的 CER 降低。
引用
@article{arxiv.2601.18393,
title = {OCR-Enhanced Multimodal ASR Can Read While Listening},
author = {Junli Chen and Changli Tang and Yixuan Li and Guangzhi Sun and Chao Zhang},
journal= {arXiv preprint arXiv:2601.18393},
year = {2026}
}
备注
4 pages, 2 figures. Submitted to ICASSP 2026