EAR: 增强弱监督音视频视频解析中的单模态表征
计算机视觉与模式识别
2026-05-12 v1 多媒体
摘要
弱监督音视频视频解析(Weakly Supervised Audio-Visual Video Parsing, AVVP)旨在仅使用粗粒度标签识别和时序定位视频中的音频、视觉及音视频事件。面对这一具挑战性的任务设置,现有研究主要沿着两条主线推进:为获得细粒度的跨模态语义指导,预训练伪标签生成器;或优化AVVP模型架构以增强音视频融合。然而,由于音频和视觉信号通常无法对齐,实现精准视频解析根本依赖于对单模态事件的精准感知。但这些以多模态为中心的策略过度强调多模态融合,而不足以引导和保留单模态语义,导致标签噪声和次优的视频解析性能。本文提出一种新框架,通过增强伪标签生成器和AVVP模型中的单模态表征。具体而言,我们引入基于相似性的标签迁移方法以注释预训练数据,从而使伪标签生成器更好地理解单模态事件。我们还采用软约束方式,在进行多模态融合的同时平行地细化单模态特征的建模。这些设计使单模态和跨模态表征能够协同关注,从而提升事件的定位性能。大量实验表明,我们的方法在伪标签和AVVP性能方面均优于当前最先进的方法。
引用
@article{arxiv.2605.08723,
title = {EAR: Enhancing Uni-Modal Representations for Weakly Supervised Audio-Visual Video Parsing},
author = {Huilai Li and Xiaomeng Di and Ying Xing and Yonghao Dang and Yiming Wang and Jianqin Yin},
journal= {arXiv preprint arXiv:2605.08723},
year = {2026}
}