面向语义噪声消除的教师引导双路径音视频表征学习
声音
2026-04-10 v1 计算机视觉与模式识别
摘要
近期音视频表征学习的进展表明,对比对齐与掩码重建的结合具有重要价值。然而,在单一前向路径中联合优化这些目标会迫使对比分支依赖于为重建设计的随机可见块,从而引入语义噪声和优化干扰。我们提出TG-DP(Teacher-Guided Dual-Path)框架,通过解耦重建与对齐到独立的优化路径来消除语义噪声。通过分离两个分支的掩码范围,TG-DP使对比路径能够使用更适合跨模态对齐的可见性模式。教师模型进一步为组织该分支中可见token提供辅助指导,帮助减少干扰并稳定跨模态表征学习。TG-DP在零样本检索中实现了最好的性能。在AudioSet上,视频到音频检索的R@1从35.2%提升至37.4%,音频到视频检索的R@1从27.9%提升至37.1%。所学到的表征也保持语义鲁棒性,在AS20K和VGGSound上实现线性探测的最佳性能。综上所述,我们的结果表明,解耦多模态目标并在对比路径中引入教师引导结构,为改进大规模音视频预训练提供了有效框架。代码已公开于https://github.com/wanglg20/TG-DP。
引用
@article{arxiv.2604.08147,
title = {Semantic Noise Reduction via Teacher-Guided Dual-Path Audio-Visual Representation Learning},
author = {Linge Wang and Yingying Chen and Bingke Zhu and Lu Zhou and Jinqiao Wang},
journal= {arXiv preprint arXiv:2604.08147},
year = {2026}
}