别被外表误导:面向运动一致视频表征
计算机视觉与模式识别
2024-03-26 v2 人工智能
机器学习
摘要
当前的对象识别训练管道在数据增广时忽略了Hue Jittering,因为它不仅会带来有害于分类的外观变化,而且在实践中实现效率较低。在本研究中,我们探讨了色度方差在视频理解情境中的作用,发现该方差具有积极影响,因为静态外观在包含运动信息的视频中不那么重要。基于此观察,我们提出了一种用于视频理解的数据增广方法,称为Motion Coherent Augmentation (MCA),该方法在视频中引入外观变化,隐式地鼓励模型优先关注运动模式,而非静态外观。具体而言,我们提出了一种操作SwapMix来高效修改视频样本的外观,并引入Variation Alignment (VA) 以解决SwapMix引起的分布偏移,迫使模型学习外观不变的表征。全面的经验评估表明,MCA在各种架构和不同数据集上均显示出有效性和广泛性,并验证了VA在其他增广方法中的应用。代码已在 https://github.com/BeSpontaneous/MCA-pytorch 上提供。
引用
@article{arxiv.2403.09506,
title = {Don't Judge by the Look: Towards Motion Coherent Video Representation},
author = {Yitian Zhang and Yue Bai and Huan Wang and Yizhou Wang and Yun Fu},
journal= {arXiv preprint arXiv:2403.09506},
year = {2024}
}
备注
Accepted by ICLR2024