LRS-VoxMM:一个面向真实场景音视频语音识别的基准测试
音频与语音处理
2026-05-01 v1 多媒体
声音
摘要
我们引入了 LRS-VoxMM,一个面向真实场景音视频语音识别(AVSR)的基准测试。该基准测试源自 VoxMM,一个包含多样化真实世界口语对话及人工标注转录的数据集。我们选择了适合 AVSR 的样本,并以 LRS 风格的格式对其进行预处理,以便直接用于现有的 AVSR 流程。与常用的基准测试相比,LRS-VoxMM 覆盖了更多样化的场景和声学条件。我们还发布了带有加性噪声、混响和带宽限制的失真评估集,以支持在严重声学退化条件下的评估。实验结果表明,LRS-VoxMM 的难度远高于 LRS3,并且随着音频信号的退化,视觉信息的贡献变得更加明显。LRS-VoxMM 支持更真实的 AVSR 基准测试,并鼓励在具有挑战性的真实世界条件下进一步研究视觉信息的作用。
引用
@article{arxiv.2604.27866,
title = {LRS-VoxMM: A benchmark for in-the-wild audio-visual speech recognition},
author = {Doyeop Kwak and Jeongsoo Choi and Suyeon Lee and Joon Son Chung},
journal= {arXiv preprint arXiv:2604.27866},
year = {2026}
}
备注
Technical report for the LRS-VoxMM dataset release. Project page: https://mm.kaist.ac.kr/projects/voxmm