鸡尾酒会场景下的视听语音识别
声音
2025-06-04 v1 计算与语言
摘要
视听语音识别(AVSR)为鸡尾酒会等挑战性环境中的语音识别提供了稳健的解决方案,在这些环境中仅依赖音频是不够的。然而,当前的 AVSR 模型通常针对说话人持续发声的理想化场景进行优化,忽略了包含说话和静默面部片段的真实世界环境的复杂性。本研究通过引入一个新颖的视听鸡尾酒会数据集来填补这一空白,该数据集旨在对当前的 AVSR 系统进行基准测试,并突出现有方法在现实噪声条件下的局限性。此外,我们贡献了一个包含 1526 小时的 AVSR 数据集,包含说话面部和静默面部片段,在鸡尾酒会环境中实现了显著的性能提升。我们的方法相对于现有技术将 WER 降低了 67%,在极端噪声下将 WER 从 119% 降至 39.2%,且不依赖显式的分割线索。
引用
@article{arxiv.2506.02178,
title = {Cocktail-Party Audio-Visual Speech Recognition},
author = {Thai-Binh Nguyen and Ngoc-Quan Pham and Alexander Waibel},
journal= {arXiv preprint arXiv:2506.02178},
year = {2025}
}
备注
Accepted at Interspeech 2025