中文

面向音视觉动作识别的抗噪声学习

计算机视觉与模式识别 2024-10-28 v3 多媒体

摘要

近年来,在多模态学习的助力下视频识别迅速兴起,其重点在于融合不同模态以提升模型的性能或鲁棒性。尽管已有多种多模态学习方法被提出并取得了显著的识别结果,但几乎所有方法都依赖于高质量的人工标注,并假设多模态数据各模态提供语义相关信息。遗憾的是,广泛使用的视频数据集通常标注粗糙或采集自互联网,因此不可避免地包含一定比例的噪声标签与噪声对应。为应对这一挑战,我们以音视觉动作识别任务为代理,提出一种抗噪声学习框架,以寻找对噪声标签和噪声对应均具抗干扰能力的模型参数。具体而言,我们的方法包含两阶段,旨在通过模态间的内在关联来纠正噪声。首先,执行抗噪声对比训练阶段,使模型对可能存在的噪声标注数据免疫。为缓解噪声对应的影响,我们提出跨模态噪声估计组件以调整不同模态间的一致性。鉴于噪声对应存在于实例层面,我们进一步提出类别级对比损失以降低其干扰。其次,在混合监督训练阶段,我们计算特征间距离度量以获得修正标签,并将其作为补充监督用于引导训练。在广泛噪声水平下的大量实验表明,我们的方法显著提升了动作识别模型的鲁棒性,并以明显优势超越基线方法。

关键词

引用

@article{arxiv.2205.07611,
  title  = {Noise-Tolerant Learning for Audio-Visual Action Recognition},
  author = {Haochen Han and Qinghua Zheng and Minnan Luo and Kaiyao Miao and Feng Tian and Yan Chen},
  journal= {arXiv preprint arXiv:2205.07611},
  year   = {2024}
}

备注

This work has been submitted to the IEEE for possible publication