CAE-AV:通过跨模态交互式丰富提升音视频学习
计算机视觉与模式识别
2026-02-10 v1
摘要
音视频学习因脱声源与背景杂乱导致模态错位,而当前方法通常放大无关区域或时刻,引发训练不稳定与表示质量下降。为此,我们提出一种新型框架:Caption-Aligned and Agreement-guided Enhancement(CAE-AV),包含两个互补模块:基于跨模态一致性的时空丰富(CASTE)与基于标题对齐的显著性导向丰富(CASE),以缓解音视频错位。CASTE通过评估帧级音视频一致性,动态平衡空间与时序关系,确保在错位情况下从前后帧中捕获关键信息;CASE注入跨模态语义指导于选定时空位置,利用高层语义线索进一步缓解错位。此外,我们设计轻量级目标函数,包括标题到模态InfoNCE、视觉-音频一致性与熵正则化,以引导token选择并强化跨模态语义对齐。采用冻结主干网络,CAE-AV在AVE、AVVP、AVS及AVQA基准上实现最先进性能,定性分析进一步验证了其对音视频错位的鲁棒性。
引用
@article{arxiv.2602.08309,
title = {CAE-AV: Improving Audio-Visual Learning via Cross-modal Interactive Enrichment},
author = {Yunzuo Hu and Wen Li and Jing Zhang},
journal= {arXiv preprint arXiv:2602.08309},
year = {2026}
}
备注
13 pages, 8 figures