为何我不能在商场里跳舞?学习缓解动作识别中的场景偏差
计算机视觉与模式识别
2019-12-12 v1
摘要
人类活动常发生于特定场景语境中,例如在篮球场上打篮球。因此,使用现有视频数据集训练模型不可避免地会捕获并利用此类偏差(而非使用实际的判别线索)。所学表征可能无法很好地泛化到新的动作类别或不同任务。本文中,我们提出缓解视频表征学习中的场景偏差。具体而言,我们在动作分类的标准交叉熵损失上增补 1)针对场景类型的对抗损失,以及 2)针对人体被掩去的人体掩码混淆损失。这两种损失鼓励学习这样的表征:在缺乏证据时无法预测场景类型与正确动作。我们通过将预训练模型迁移至三项不同任务来验证方法有效性,包括动作分类、时间定位与时空动作检测。我们的结果显示相较无去偏的基线模型有持续改进。
引用
@article{arxiv.1912.05534,
title = {Why Can't I Dance in the Mall? Learning to Mitigate Scene Bias in Action Recognition},
author = {Jinwoo Choi and Chen Gao and Joseph C. E. Messou and Jia-Bin Huang},
journal= {arXiv preprint arXiv:1912.05534},
year = {2019}
}
备注
NeurIPS 2019. Project webpage: http://chengao.vision/SDN/ Code: https://github.com/vt-vl-lab/SDN