重新审视跨域开放词汇动作识别中的基于CLIP的视频学习器
计算机视觉与模式识别
2024-05-27 v2
摘要
基于CLIP(对比语言-图像预训练)的巨大成功,近期开创性工作提出将强大的CLIP适配到视频数据,从而产生了高效且有效的用于开放词汇动作识别的视频学习器。受人类在多样化环境中执行动作的启发,我们的工作深入探讨了一个有趣的问题:基于CLIP的视频学习器能否有效地泛化到训练中未曾见过的视频领域?为了回答这个问题,我们建立了一个名为XOV-Action的跨域开放词汇动作识别基准,并在各种类型的领域差距下对五种最先进的基于CLIP的视频学习器进行了全面评估。评估表明,先前的方法在未见过的视频领域中表现出有限的动作识别性能,揭示了跨域开放词汇动作识别任务的潜在挑战。在本文中,我们聚焦于该任务的一个关键挑战,即场景偏差,并据此提出了一种新颖的场景感知视频-文本对齐方法。我们的核心思想是将视频表示与场景编码的文本表示区分开来,旨在学习与场景无关的视频表示,以跨域识别动作。大量实验证明了我们方法的有效性。基准和代码将在https://github.com/KunyuLin/XOV-Action/提供。
引用
@article{arxiv.2403.01560,
title = {Rethinking CLIP-based Video Learners in Cross-Domain Open-Vocabulary Action Recognition},
author = {Kun-Yu Lin and Henghui Ding and Jiaming Zhou and Yu-Ming Tang and Yi-Xing Peng and Zhilin Zhao and Chen Change Loy and Wei-Shi Zheng},
journal= {arXiv preprint arXiv:2403.01560},
year = {2024}
}