中文

CoGenAV:基于对比-生成同步的通用音视频表征学习

声音 2025-05-16 v2 计算机视觉与模式识别 音频与语音处理

摘要

说话者的唇部运动、声音和底层语言内容之间的内在同步性为改善语音处理任务提供了丰富的信息源,尤其是在传统纯音频系统失效的挑战性条件下。我们提出了 CoGenAV,一个强大且数据高效的模型,旨在学习适用于广泛语音和音视频任务的通用音视频表征。CoGenAV 通过优化一个源自自然音视频同步性的双重目标——对比特征对齐和生成式文本预测——进行训练,仅使用了来自 LRS2 数据集的 223 小时标注数据。这种对比-生成同步策略有效地捕捉了基本的跨模态关联。我们在多个基准上展示了所学 CoGenAV 表征的有效性和通用性。当用于 LRS2 上的音视频语音识别 (AVSR) 时,这些表征有助于实现 1.27 的最新词错误率 (WER)。它们还在 LRS2 上的视觉语音识别 (VSR) 中实现了 20.5 的 WER,并在噪声环境中将性能显著提升了 70% 以上。此外,CoGenAV 表征有益于语音重建任务,提升了语音增强和分离的性能,并在主动说话人检测 (ASD) 等音视频同步任务中取得了有竞争力的结果。我们的模型将开源,以促进学术界和工业界的进一步发展和合作。

关键词

引用

@article{arxiv.2505.03186,
  title  = {CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization},
  author = {Detao Bai and Zhiheng Ma and Xihan Wei and Liefeng Bo},
  journal= {arXiv preprint arXiv:2505.03186},
  year   = {2025}
}