中文

VTG-GPT:基于 GPT 的免微调零样本视频时序定位

计算机视觉与模式识别 2024-03-05 v1 人工智能

摘要

视频时序定位旨在根据语言查询从未剪辑视频中定位特定时序片段。大多数现有 VTG 模型在大量标注的视频-文本对上进行训练,这一过程不仅引入了查询中的人类偏见,还产生了高昂的计算成本。为了应对这些挑战,我们提出了 VTG-GPT,一种基于 GPT 的零样本 VTG 方法,无需训练或微调。为了减少原始查询中的偏见,我们使用 Baichuan2 生成去偏查询。为了减少视频中的冗余信息,我们应用 MiniGPT-v2 将视觉内容转换为更精确的字幕。最后,我们设计了提议生成器和后处理模块,以从去偏查询和图像字幕中生成准确的片段。大量实验表明,VTG-GPT 在零样本设置下显著优于 SOTA 方法,并超越了无监督方法。更值得注意的是,它取得了与有监督方法相当的具有竞争力的性能。代码可在 https://github.com/YoucanBaby/VTG-GPT 获取

关键词

引用

@article{arxiv.2403.02076,
  title  = {VTG-GPT: Tuning-Free Zero-Shot Video Temporal Grounding with GPT},
  author = {Yifang Xu and Yunzhuo Sun and Zien Xie and Benxiang Zhai and Sidan Du},
  journal= {arXiv preprint arXiv:2403.02076},
  year   = {2024}
}

备注

15 pages, 7 figures