中文

用于视频域适应的跨模态对比特征学习

计算机视觉与模式识别 2021-08-30 v1

摘要

从视频中学习可迁移且域适应的特征表示对于动作识别等视频相关任务非常重要。现有的视频域适应方法主要依赖于源自 RGB 图像空间的对抗特征对齐。然而,视频数据通常伴有多模态信息(例如 RGB 和光流),因此在跨域适应设置下设计一种能更好处理跨模态输入的方法仍是一个挑战。为此,我们提出了一个用于视频域适应的统一框架,该框架同时对跨模态和跨域特征表示进行正则化。具体而言,我们将一个域中的每个模态视为一个视图,并利用具有精心设计的采样策略的对比学习技术。因此,我们的目标函数对原本缺乏跨模态联系或跨域对齐较少的特征空间进行了正则化。我们在域适应动作识别基准数据集(即 UCF、HMDB 和 EPIC-Kitchens)上进行了实验,并证明了我们的组件相对于最先进算法的有效性。

关键词

引用

@article{arxiv.2108.11974,
  title  = {Learning Cross-modal Contrastive Features for Video Domain Adaptation},
  author = {Donghyun Kim and Yi-Hsuan Tsai and Bingbing Zhuang and Xiang Yu and Stan Sclaroff and Kate Saenko and Manmohan Chandraker},
  journal= {arXiv preprint arXiv:2108.11974},
  year   = {2021}
}

备注

Accepted in ICCV'21