中文

使用主动说话人注意力模块的端到端多说话人音视觉语音识别

声音 2022-04-05 v1 计算与语言 音频与语音处理

摘要

本文提出一种用于端到端音视觉多说话人语音识别的新方法。该方法在此称为视觉上下文注意力模型 (VCAM),其重要性在于利用可用的视频信息将解码文本分配给多个可见人脸之一。这从根本上解决了多数多说话人建模方法所面临的标签歧义问题——此类方法可解码多个标签字符串,却无法将标签字符串分配给正确说话人。该模型以基于 transformer-transducer 的端到端模型实现,并使用从 YouTube 视频创建的二人音视觉重叠语音数据集进行评估。文中表明,相较于先前报道的纯音频与音视觉多说话人 ASR 系统,VCAM 模型提升了性能。

关键词

引用

@article{arxiv.2204.00652,
  title  = {End-to-end multi-talker audio-visual ASR using an active speaker attention module},
  author = {Richard Rose and Olivier Siohan},
  journal= {arXiv preprint arXiv:2204.00652},
  year   = {2022}
}

备注

5 pages, 3 figures, 3 tables, 28 citations