中文

DEVIAS:学习动作与场景的解耦视频表示

计算机视觉与模式识别 2024-09-09 v3

摘要

视频识别模型常因训练数据中动作与场景的虚假相关性而学习到场景偏置的动作表示。当测试数据包含未见过的动作-场景组合时,此类模型表现不佳。尽管场景去偏的动作识别模型可能解决该问题,但它们往往忽略了数据中有价值的场景信息。为应对这一挑战,我们提出学习动作与场景的解耦视频表示(DEVIAS),以实现更全面的视频理解。我们提出一种编码器-解码器架构,用单一模型学习解耦的动作和场景表示。该架构由解耦编码器(DE)、动作掩码解码器(AMD)和预测头组成。实现解耦的关键是在训练时同时使用DE和AMD。DE利用槽注意力机制学习解耦的动作和场景表示。为进一步解耦,AMD学习根据动作槽预测动作掩码。利用得到的解耦表示,我们能在包括已见和未见动作-场景组合的各种场景下实现鲁棒性能。我们在UCF-101、Kinetics-400和HVU数据集上对已见场景,以及在SCUBA、HAT和HVU数据集上对未见动作-场景组合场景进行了严格验证。此外,DEVIAS提供了根据下游任务的数据集特征调整对动作或场景信息关注程度的灵活性。DEVIAS在多种下游任务中表现出色:Diving48、Something-Something-V2、UCF-101和ActivityNet。代码见https://github.com/KHU-VLL/DEVIAS。

关键词

引用

@article{arxiv.2312.00826,
  title  = {DEVIAS: Learning Disentangled Video Representations of Action and Scene},
  author = {Kyungho Bae and Geo Ahn and Youngrae Kim and Jinwoo Choi},
  journal= {arXiv preprint arXiv:2312.00826},
  year   = {2024}
}

备注

Accepted to ECCV 2024 (Oral). Project page : https://khu-vll.github.io/DEVIAS/