面向无约束视频的鲁棒跨模态知识蒸馏
计算机视觉与模式识别
2023-04-28 v2 多媒体
摘要
跨模态蒸馏已被广泛用于在不同模态间迁移知识,丰富目标单模态的表征。近期研究将视觉与声音之间的时间同步高度关联到语义一致性以进行跨模态蒸馏。然而,在无约束视频中,由于无关的模态噪声与差异化的语义相关性,这种来自同步的语义一致性难以保证。为此,我们首先提出一个模态噪声滤波器(MNF)模块,利用跨模态上下文消除教师模态中的无关噪声。在此净化之后,我们设计了一个对比语义校准(CSC)模块,通过参考以对比方式呈现的差异化样本级语义相关性,为目标模态自适应地蒸馏有用知识。大量实验表明,相较于其他蒸馏方法,我们的方法在视觉动作识别与视频检索任务中均能带来性能提升。我们还将其扩展至音频标注任务以证明方法的泛化性。源代码可在 https://github.com/GeWu-Lab/cross-modal-distillation 获取。
引用
@article{arxiv.2304.07775,
title = {Robust Cross-Modal Knowledge Distillation for Unconstrained Videos},
author = {Wenke Xia and Xingjian Li and Andong Deng and Haoyi Xiong and Dejing Dou and Di Hu},
journal= {arXiv preprint arXiv:2304.07775},
year = {2023}
}