用于弱监督音视频视频解析的多模态不平衡感知梯度调制
计算机视觉与模式识别
2023-07-06 v1
摘要
弱监督音视频视频解析(WS-AVVP)旨在仅利用视频级类别标签进行训练,定位音频、视觉及音视觉事件实例的时间范围并识别相应事件类别。以往多数方法重点关注细化各模态的监督或提取丰富的跨模态信息以获得更可靠的特征学习。它们均未注意到该任务中不同模态间不平衡的特征学习。本文中,为平衡不同模态的特征学习过程,探究了一种动态梯度调制(DGM)机制,其中设计了一种新颖有效的度量函数来衡量音频与视觉模态间不平衡的特征学习。此外,原理分析表明,多模态混淆计算会妨碍对多模态不平衡特征学习的精确度量,进而削弱我们 DGM 机制的有效性。为应对此问题,设计了模态分离决策单元(MSDU)以更精确地度量音频与视觉模态间不平衡的特征学习。在公开基准上进行了综合实验,相应实验结果证明了我们所提方法的有效性。
引用
@article{arxiv.2307.02041,
title = {Multimodal Imbalance-Aware Gradient Modulation for Weakly-supervised Audio-Visual Video Parsing},
author = {Jie Fu and Junyu Gao and Changsheng Xu},
journal= {arXiv preprint arXiv:2307.02041},
year = {2023}
}