从无纠缠视角看无监督视频域自适应动作识别
计算机视觉与模式识别
2023-10-25 v3 人工智能
机器学习
摘要
无监督视频域自适应是一项实用却具挑战性的任务。在本工作中,我们首次从无纠缠(disentanglement)的视角解决该问题。我们的核心思想是通过无纠缠分别处理空间与时间域差异。具体而言,我们考虑由两组潜在因子生成跨域视频:一组编码静态信息,另一组编码动态信息。随后我们开发了迁移序列VAE(TranSVAE)框架来建模此种生成过程。为更好地服务于自适应,我们提出了若干目标来约束潜在因子。在这些约束下,空间差异可通过将静态域特定信息无纠缠出来而轻易消除,时间差异则通过对抗学习在帧级和视频级两个层面被进一步减小。在UCF-HMDB、Jester和Epic-Kitchens数据集上的大量实验验证了TranSVAE相较于若干最先进(SOTA)方法的有效性与优越性。代码已公开可用。
引用
@article{arxiv.2208.07365,
title = {Unsupervised Video Domain Adaptation for Action Recognition: A Disentanglement Perspective},
author = {Pengfei Wei and Lingdong Kong and Xinghua Qu and Yi Ren and Zhiqiang Xu and Jing Jiang and Xiang Yin},
journal= {arXiv preprint arXiv:2208.07365},
year = {2023}
}
备注
NeurIPS 2023; 20 pages, 9 figures, 10 tables; Code at https://github.com/ldkong1205/TranSVAE