面向零样本视频定位的无语言训练
计算机视觉与模式识别
2022-10-25 v1
摘要
给定一个未裁剪视频和描述视频中特定时间片段的语言查询,视频定位旨在通过同时理解文本与视频来定位该时间间隔。最具挑战性的问题之一是极其耗时且昂贵的标注收集,包括自然语言形式的视频字幕及其对应的时间区域。在本文中,我们提出了一种简单而新颖的零样本设置下视频定位训练框架,其仅使用视频数据而不借助任何标注来学习网络。受近期无语言范式(即无语言数据训练)的启发,我们训练网络时不强制生成伪造(伪)文本查询为自然语言形式。具体而言,我们提出一种通过学习视频定位模型的方法:选择一个时间间隔作为假设正确答案,并将该方法在该间隔内选出的视觉特征视为语言特征,借助CLIP良好对齐的视觉-语言空间。大量实验证明了我们无语言训练框架的优越性,在两个标准数据集上以大幅优势超越现有零样本视频定位方法甚至若干弱监督方法。
引用
@article{arxiv.2210.12977,
title = {Language-free Training for Zero-shot Video Grounding},
author = {Dahye Kim and Jungin Park and Jiyoung Lee and Seongheon Park and Kwanghoon Sohn},
journal= {arXiv preprint arXiv:2210.12977},
year = {2022}
}
备注
Accepted to WACV 2023