结合领域自适应的多样化数据增强用于去偏视频时序定位
计算机视觉与模式识别
2025-01-15 v2
摘要
视频时序句子定位 (TSGV) 面临着挑战,因为公开的 TSGV 数据集包含显著的时序偏差,这归因于目标时刻的不均匀时序分布。现有方法生成增强视频,其中目标时刻被强制具有不同的时序位置。然而,由于给定数据集的视频长度变化较小,仅改变时序位置会导致在长度不同的视频上泛化能力较差。在本文中,我们提出了一种由多样化数据增强和领域判别器补充的新型训练框架。数据增强生成具有不同长度和目标时刻位置的视频,以使时序分布多样化。然而,增强后的视频不可避免地表现出不同的特征分布,这可能会引入噪声。为了解决这个问题,我们设计了一个领域自适应辅助任务,以减少原始视频和增强视频之间的特征差异。我们还鼓励模型对具有相同文本查询但时刻位置不同的视频产生不同的预测,以促进去偏训练。在 Charades-CD 和 ActivityNet-CD 数据集上的实验证明了我们方法在多种定位结构中的有效性和泛化能力,取得了 state-of-the-art 的结果。
引用
@article{arxiv.2501.06746,
title = {Diversified Augmentation with Domain Adaptation for Debiased Video Temporal Grounding},
author = {Junlong Ren and Gangjian Zhang and Haifeng Sun and Hao Wang},
journal= {arXiv preprint arXiv:2501.06746},
year = {2025}
}
备注
Accepted by ICASSP 2025