EquiAV:利用等变性进行音视频对比学习
机器学习
2024-06-21 v2 人工智能
多媒体
摘要
近期的自监督音视频表征学习取得的进展表明,其潜力在于捕获丰富且全面的表征。然而,尽管数据增广在许多学习方法中已证明具有优势,但音视频学习在充分利用这些优势方面一直受限,因为增广容易破坏输入对之间的对应关系。为此,我们提出EquiAV,一个利用等变性进行音视频对比学习的新框架。我们的方法从扩展等变性到音视频学习开始,借助共享的注意力-based 转换预测器。这使我们能够将来自不同增广的特征聚合到一个代表性嵌入中,提供稳健的监督。值得注意的是,这是在最小计算开销的条件下实现的。广泛的消融研究和定性结果验证了我们方法的有效性。EquiAV在各种音视频基准测试中均优于先前方法。代码已在 https://github.com/JongSuk1/EquiAV 上提供。
关键词
引用
@article{arxiv.2403.09502,
title = {EquiAV: Leveraging Equivariance for Audio-Visual Contrastive Learning},
author = {Jongsuk Kim and Hyeongkeun Lee and Kyeongha Rho and Junmo Kim and Joon Son Chung},
journal= {arXiv preprint arXiv:2403.09502},
year = {2024}
}
备注
15 pages, 3 figures; Accepted to ICML 2024 (camera ready version)