中文

为何我不能在商场里跳舞?学习缓解动作识别中的场景偏差

计算机视觉与模式识别 2019-12-12 v1

摘要

人类活动常发生于特定场景语境中,例如在篮球场上打篮球。因此,使用现有视频数据集训练模型不可避免地会捕获并利用此类偏差(而非使用实际的判别线索)。所学表征可能无法很好地泛化到新的动作类别或不同任务。本文中,我们提出缓解视频表征学习中的场景偏差。具体而言,我们在动作分类的标准交叉熵损失上增补 1)针对场景类型的对抗损失,以及 2)针对人体被掩去的人体掩码混淆损失。这两种损失鼓励学习这样的表征:在缺乏证据时无法预测场景类型与正确动作。我们通过将预训练模型迁移至三项不同任务来验证方法有效性,包括动作分类、时间定位与时空动作检测。我们的结果显示相较无去偏的基线模型有持续改进。

关键词

引用

@article{arxiv.1912.05534,
  title  = {Why Can't I Dance in the Mall? Learning to Mitigate Scene Bias in Action Recognition},
  author = {Jinwoo Choi and Chen Gao and Joseph C. E. Messou and Jia-Bin Huang},
  journal= {arXiv preprint arXiv:1912.05534},
  year   = {2019}
}

备注

NeurIPS 2019. Project webpage: http://chengao.vision/SDN/ Code: https://github.com/vt-vl-lab/SDN