面向有效高效视频无监督域适应的可学习运动聚焦化词
计算机视觉与模式识别
2026-04-14 v1
摘要
视频无监督域适应 (VUDA) 在行动识别中提出了重大挑战,要求模型从标记的源域适应到未标记的目标域。尽管近期取得的进展,但现有 VUDA 方法往往难以达到完全监督的性能,这是由于静态且信息不足的背景导致领域偏移加剧的主要原因之一。此外,先前的方法往往忽视计算效率,这限制了在实际中的采纳。为此,我们提出了可学习的运动聚焦化词 (LMFT) 用于 VUDA。LMFT 将视频帧分解为补丁 token,并学习删除低运动、冗余的 token,主要对应背景区域,同时保留富含运动的、与行动相关的 token 以进行适应。我们在三个标准 VUDA 基准测试中的 21 种域适应设置上进行了广泛实验,表明我们搭载 LMFT 的 VUDA 框架在实现 state-of-the-art 性能的同时,显著降低了计算开销。LMFT 因此使得 VUDA 既有效又高效。
引用
@article{arxiv.2604.09955,
title = {Learnable Motion-Focused Tokenization for Effective and Efficient Video Unsupervised Domain Adaptation},
author = {Tzu Ling Liu and Ian Stavness and Mrigank Rochan},
journal= {arXiv preprint arXiv:2604.09955},
year = {2026}
}
备注
Accepted to IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026