中文

通过大规模多模态对应学习推进听觉-视觉感知边界

声音 2025-12-23 v1 计算机视觉与模式识别 机器学习

摘要

我们介绍了 Perception Encoder Audiovisual (PE-AV),这是一套新的音频和视频理解编码器,通过规模化对比学习进行训练。基于 PE,PE-AV 对扩展表征以支持音频,以及原生支持跨音频-视频、音频-文本和视频-文本模态的联合嵌入做出了多项关键贡献。PE-AV 的统一跨模态嵌入使我们能够实现新任务,如语音检索,并在标准音频和视频基准测试中取得新的学习成果。我们通过构建强大的听觉-视觉数据引擎来实现这一点,该引擎为 O(10000 万) 组音频-视频对合成高质量描述,实现跨模态一致的大规模监督。我们的音频数据包括语音、音乐和一般音效——避免了以往工作中常见的单一领域限制。我们利用十种成对对比目标,表明扩大跨模态和描述类型配对有助于增强对齐并改进零样本性能。我们进一步开发了 PE-A-Frame,通过采用帧级对比目标对 PE-AV 进行微调,实现了面向声音事件检测等任务的音频-帧到文本的细粒度对齐。

关键词

引用

@article{arxiv.2512.19687,
  title  = {Pushing the Frontier of Audiovisual Perception with Large-Scale Multimodal Correspondence Learning},
  author = {Apoorv Vyas and Heng-Jui Chang and Cheng-Fu Yang and Po-Yao Huang and Luya Gao and Julius Richter and Sanyuan Chen and Matt Le and Piotr Dollár and Christoph Feichtenhofer and Ann Lee and Wei-Ning Hsu},
  journal= {arXiv preprint arXiv:2512.19687},
  year   = {2025}
}