中文

基于视频引导的电视剧语音识别后修正

声音 2026-03-17 v3 人工智能 音频与语音处理

摘要

自动语音识别 (ASR) 由于深度学习技术取得了显著进展,推动了对话人工智能、媒体转录和辅助技术等领域的发展。然而,ASR 系统在复杂环境中仍面临挑战,例如电视剧中存在多个说话者、重叠语音、领域特定术语以及长程上下文依赖,这些因素对转录准确率构成显著挑战。现有方法未能充分利用视频中丰富的时序和上下文信息。为此,我们提出一种基于视频的后 ASR 纠正 (VPC) 框架,该框架使用 Video-Large Multimodal Model (VLMM) 捕获视频上下文并修正 ASR 输出。在电视剧基准数据集上的评估表明,我们的方法在复杂多媒体环境中 consistently 改进了转录准确率。

关键词

引用

@article{arxiv.2506.07323,
  title  = {Speech Recognition on TV Series with Video-guided Post-ASR Correction},
  author = {Haoyuan Yang and Yue Zhang and Liqiang Jing and John H. L. Hansen},
  journal= {arXiv preprint arXiv:2506.07323},
  year   = {2026}
}

备注

Submitted to Interspeech 2026