当 AVSR 遇见视频会议:数据集、退化及其性能崩溃背后的隐藏机制
计算机视觉与模式识别
2026-03-25 v1
摘要
音频-视觉语音识别(AVSR)在离线条件下已取得显著进展,但其在实际视频会议(VC)环境中的鲁棒性仍鲜有探讨。本文系统评估了主流视频会议平台上的最新AVSR模型,揭示了传输失真和人类自发夸张表达导致的严重性能下降。为此,我们构建了第一个专为VC设计的多模态数据集——MLD-VC,包含31位说话者、22.79小时音频-视觉数据,并利用洛伦兹效应增强人类夸张表达。通过全面分析发现,语音增强算法是分布迁移的主要来源, alters 音频的前两共振峰。有趣的是,洛伦兹效应引起的分布迁移与语音增强引起的分布迁移非常相似,这解释了为何在VC环境中,基于洛伦兹数据训练的模型表现更好。对AVSR模型在MLD-VC上进行微调可显著缓解此问题,在多个VC平台上实现CER平均降低17.5%。我们的发现和数据集为开发更可靠、更通用的视频会议AVSR系统奠定了基础。MLD-VC已在 https://huggingface.co/datasets/nccm2p2/MLD-VC 上提供。
引用
@article{arxiv.2603.22915,
title = {When AVSR Meets Video Conferencing: Dataset, Degradation, and the Hidden Mechanism Behind Performance Collapse},
author = {Yihuan Huang and Jun Xue and Liu Jiajun and Daixian Li and Tong Zhang and Zhuolin Yi and Yanzhen Ren and Kai Li},
journal= {arXiv preprint arXiv:2603.22915},
year = {2026}
}