中文

别被外表误导:面向运动一致视频表征

计算机视觉与模式识别 2024-03-26 v2 人工智能 机器学习

摘要

当前的对象识别训练管道在数据增广时忽略了Hue Jittering,因为它不仅会带来有害于分类的外观变化,而且在实践中实现效率较低。在本研究中,我们探讨了色度方差在视频理解情境中的作用,发现该方差具有积极影响,因为静态外观在包含运动信息的视频中不那么重要。基于此观察,我们提出了一种用于视频理解的数据增广方法,称为Motion Coherent Augmentation (MCA),该方法在视频中引入外观变化,隐式地鼓励模型优先关注运动模式,而非静态外观。具体而言,我们提出了一种操作SwapMix来高效修改视频样本的外观,并引入Variation Alignment (VA) 以解决SwapMix引起的分布偏移,迫使模型学习外观不变的表征。全面的经验评估表明,MCA在各种架构和不同数据集上均显示出有效性和广泛性,并验证了VA在其他增广方法中的应用。代码已在 https://github.com/BeSpontaneous/MCA-pytorch 上提供。

关键词

引用

@article{arxiv.2403.09506,
  title  = {Don't Judge by the Look: Towards Motion Coherent Video Representation},
  author = {Yitian Zhang and Yue Bai and Huan Wang and Yizhou Wang and Yun Fu},
  journal= {arXiv preprint arXiv:2403.09506},
  year   = {2024}
}

备注

Accepted by ICLR2024