看似相似,听来不同:利用反事实跨模态对进行音视频表征学习
声音
2024-06-11 v2 计算机视觉与模式识别
机器学习
多媒体
音频与语音处理
摘要
音视频表征学习通常依赖于视觉与听觉之间的对应关系。然而,往往存在多条可与同一视觉场景对应的音轨。例如,在同一条拥挤街道上的不同对话。此类反事实对音视频表征学习的影响此前未被探究。为研究此问题,我们使用电影与电视节目的配音版本来增强跨模态对比学习。我们的方法学习将仅言语不同、其余相似的替代音轨表示为与同一视频相似。我们来自一组探究不同训练策略的综合实验的结果表明,这一通用方法在一系列下游听觉与音视频任务上提升了性能,且总体上未显著影响语言任务表现。这些发现凸显了在学习场景级音视频对应时考虑言语变化的重要性,并提示配音音频可作为一种有用的增强技术,用于训练音视频模型以在多样下游任务上获得更鲁棒的性能。
引用
@article{arxiv.2304.05600,
title = {Looking Similar, Sounding Different: Leveraging Counterfactual Cross-Modal Pairs for Audiovisual Representation Learning},
author = {Nikhil Singh and Chih-Wei Wu and Iroro Orife and Mahdi Kalayeh},
journal= {arXiv preprint arXiv:2304.05600},
year = {2024}
}
备注
Accepted to CVPR 2024