中文

利用多模态信息校准类别权重的部分视频域自适应方法

计算机视觉与模式识别 2022-07-12 v3

摘要

假设源标签空间包含目标标签空间,部分视频域自适应(PVDA)是跨域视频分类问题中更通用且实用的场景。PVDA 的关键挑战是缓解仅源域离群类所引起的负迁移。应对该挑战的关键一步是聚合目标预测,通过上调目标类权重与下调离群类权重来分配类别权重。然而,类别权重的错误预测会误导网络并导致负迁移。先前工作利用时间特征与注意力机制提升类别权重准确率,但在大多数真实场景那样域偏移显著时,这些方法难以生成准确的类别权重。为应对这些挑战,我们提出多模态簇校准部分对抗网络(MCAN)。MCAN 利用多时间尺度的多模态特征增强视频特征提取,以形成更鲁棒的整体特征。它采用一种新颖的类别权重校准方法来缓解由错误类别权重引起的负迁移。该校准方法试图利用无监督聚类所隐含的分布信息来识别并权衡正确与错误的预测。我们在主流 PVDA 基准上进行了大量实验,所提 MCAN 相较于最先进的 PVDA 方法取得了显著改进。

关键词

引用

@article{arxiv.2204.06187,
  title  = {Calibrating Class Weights with Multi-Modal Information for Partial Video Domain Adaptation},
  author = {Xiyu Wang and Yuecong Xu and Kezhi Mao and Jianfei Yang},
  journal= {arXiv preprint arXiv:2204.06187},
  year   = {2022}
}

备注

Accepted by ACM Multimedia (ACMMM) 2022, update to camera-ready version. 8 pages of text, 5 figures, 2 tables