中文

看似相似,听来不同:利用反事实跨模态对进行音视频表征学习

声音 2024-06-11 v2 计算机视觉与模式识别 机器学习 多媒体 音频与语音处理

摘要

音视频表征学习通常依赖于视觉与听觉之间的对应关系。然而,往往存在多条可与同一视觉场景对应的音轨。例如,在同一条拥挤街道上的不同对话。此类反事实对音视频表征学习的影响此前未被探究。为研究此问题,我们使用电影与电视节目的配音版本来增强跨模态对比学习。我们的方法学习将仅言语不同、其余相似的替代音轨表示为与同一视频相似。我们来自一组探究不同训练策略的综合实验的结果表明,这一通用方法在一系列下游听觉与音视频任务上提升了性能,且总体上未显著影响语言任务表现。这些发现凸显了在学习场景级音视频对应时考虑言语变化的重要性,并提示配音音频可作为一种有用的增强技术,用于训练音视频模型以在多样下游任务上获得更鲁棒的性能。

关键词

引用

@article{arxiv.2304.05600,
  title  = {Looking Similar, Sounding Different: Leveraging Counterfactual Cross-Modal Pairs for Audiovisual Representation Learning},
  author = {Nikhil Singh and Chih-Wei Wu and Iroro Orife and Mahdi Kalayeh},
  journal= {arXiv preprint arXiv:2304.05600},
  year   = {2024}
}

备注

Accepted to CVPR 2024