面向视频域泛化的时空感知多样化方法
计算机视觉与模式识别
2023-10-30 v1
摘要
视频域泛化旨在通过在源域中训练,学习可泛化至未见目标域的视频分类模型。视频域泛化面临的一个关键挑战是,在识别目标视频时过度依赖从源域提取的域特定线索。为此,我们提出感知视频中多样的时空线索,旨在除域特定线索外发现潜在的域不变线索。我们提出了一种名为时空多样化网络(Spatial-Temporal Diversification Network, STDN)的新模型,从视频数据的空间和时间两个维度提升多样性。首先,STDN通过空间分组在单帧内发现多种类型的空间线索。然后,STDN通过时空关系建模显式地在多时空尺度上建模视频内容之间的时空依赖关系。在三种不同类型基准上的大量实验证明了我们方法的有效性和通用性。
引用
@article{arxiv.2310.17942,
title = {Diversifying Spatial-Temporal Perception for Video Domain Generalization},
author = {Kun-Yu Lin and Jia-Run Du and Yipeng Gao and Jiaming Zhou and Wei-Shi Zheng},
journal= {arXiv preprint arXiv:2310.17942},
year = {2023}
}
备注
Accepted to NeurIPS 2023. Code is available at https://github.com/KunyuLin/STDN/