中文

音视频类增量学习

计算机视觉与模式识别 2023-10-17 v3

摘要

本文提出音视频类增量学习,一种面向音视频视频识别的类增量学习场景。我们证明联合音视频建模可改善类增量学习,但现有方法随着增量步数增长无法保持音视频特征间的语义相似性。此外,我们观察到先前任务中学到的音视频相关性会随增量步推进而被遗忘,导致性能下降。为克服这些挑战,我们提出 AV-CIL,其包含双音视频相似性约束(D-AVSC)以保持音视频模态间实例感知与类感知的语义相似性,以及视觉注意力蒸馏(VAD)以保留先前学到的音频引导视觉注意力能力。我们基于 AVE、Kinetics-Sounds 和 VGGSound 数据集分别构建了三个音视频类增量数据集:AVE-Class-Incremental (AVE-CI)、Kinetics-Sounds-Class-Incremental (K-S-CI) 和 VGGSound100-Class-Incremental (VS100-CI)。在 AVE-CI、K-S-CI 和 VS100-CI 上的实验表明,AV-CIL 在音视频类增量学习中显著优于现有类增量学习方法。代码与数据见:https://github.com/weiguoPian/AV-CIL_ICCV2023。

关键词

引用

@article{arxiv.2308.11073,
  title  = {Audio-Visual Class-Incremental Learning},
  author = {Weiguo Pian and Shentong Mo and Yunhui Guo and Yapeng Tian},
  journal= {arXiv preprint arXiv:2308.11073},
  year   = {2023}
}

备注

Accepted at ICCV 2023