面向类别增量音视频识别的层次增强与蒸馏
计算机视觉与模式识别
2024-06-10 v3
摘要
音视频视频识别(AVVR)旨在整合音频和视觉线索以准确对视频进行分类。尽管现有方法使用提供的数据集训练AVVR模型并取得了令人满意的结果,但在现实场景中面对新类别时,它们难以保留历史类别知识。目前尚无专门的方法来解决这一问题,因此本文专注于探索类别增量音视频视频识别(CIAVVR)。对于CIAVVR,由于过去类别的存储数据和已学习模型均包含历史知识,核心挑战在于如何捕获过去的数据知识和过去的模型知识以防止灾难性遗忘。我们引入了层次增强与蒸馏(HAD),它由层次增强模块(HAM)和层次蒸馏模块(HDM)组成,以分别高效利用数据和模型的层次结构。具体而言,HAM实施了一种新颖的增强策略,即分段特征增强,以保留层次模型知识。同时,HDM引入了新设计的层次(视频-分布)逻辑蒸馏和层次(片段-视频)相关蒸馏,以分别捕获和维持每个数据的层次样本内知识以及数据间的层次样本间知识。在四个基准(AVE、AVK-100、AVK-200和AVK-400)上的评估表明,所提出的HAD有效捕获了数据和模型中的层次信息,从而更好地保留了历史类别知识并提升了性能。此外,我们提供了理论分析以支持分段特征增强策略的必要性。
引用
@article{arxiv.2401.06287,
title = {Hierarchical Augmentation and Distillation for Class Incremental Audio-Visual Video Recognition},
author = {Yukun Zuo and Hantao Yao and Liansheng Zhuang and Changsheng Xu},
journal= {arXiv preprint arXiv:2401.06287},
year = {2024}
}
备注
Accepted by TPAMI