面向大规模视频域适应的时序注意力对齐
计算机视觉与模式识别
2019-09-17 v6 机器学习
多媒体
图像与视频处理
摘要
尽管近年来提出了多种基于图像的域适应(DA)技术,视频中的域偏移仍未被充分探索。大多数先前工作仅在饱和的小规模数据集上评估性能。因此,我们首先提出两个具有更大域差异的大规模视频 DA 数据集:UCF-HMDB_full 和 Kinetics-Gameplay。其次,我们研究了不同的视频 DA 集成方法,并表明即使没有复杂的 DA 方法,同时对齐和学习时序动态也能实现有效对齐。最后,我们提出时序注意力对抗适应网络(TA3N),其利用域差异显式关注时序动态以实现更有效的域对齐,在四个视频 DA 数据集上达到最先进性能(例如在“HMDB --> UCF”上相较“仅源域”从 73.9% 到 81.8% 获得 7.9% 准确率提升,在“Kinetics --> Gameplay”上获得 10.3% 提升)。代码和数据发布于 http://github.com/cmhungsteve/TA3N。
引用
@article{arxiv.1907.12743,
title = {Temporal Attentive Alignment for Large-Scale Video Domain Adaptation},
author = {Min-Hung Chen and Zsolt Kira and Ghassan AlRegib and Jaekwon Yoo and Ruxin Chen and Jian Zheng},
journal= {arXiv preprint arXiv:1907.12743},
year = {2019}
}
备注
ICCV 2019 (Oral) camera-ready + supplementary. Code and data: http://github.com/cmhungsteve/TA3N