中文

CBVS:面向真实短视频搜索场景的大规模中文图文基准

计算机视觉与模式识别 2024-01-26 v2 多媒体

摘要

在大规模图文数据集上预训练的视觉-语言模型在图像检索等下游任务中表现出色。用于预训练的大多数图像以开放领域常识视觉元素的形式呈现。不同的是,短视频搜索场景中的短视频封面呈现为用户提供的内容,提供了视频的重要视觉摘要。此外,部分视频封面带有手动设计的封面文本,提供语义补充。为了填补短视频封面数据的空白,我们建立了首个面向中文短视频搜索场景的大规模封面文本基准。具体而言,我们发布了两个大规模数据集 CBVS-5M/10M 以提供短视频封面,以及手动精细标注的数据集 CBVS-20K 以提供真实用户查询,作为中文短视频搜索领域的图文基准测试。为了在模态缺失的情况下整合封面文本的语义,我们提出了 UniCLIP,其中封面文本在训练期间起引导作用,但在推理时不依赖它。在 CBVS-20K 上的广泛评估证明了我们方案的优异性能。UniCLIP 已部署于访问量数亿的腾讯在线视频搜索系统,并取得了显著收益。数据集和代码可在 https://github.com/QQBrowserVideoSearch/CBVS-UniCLIP 获取。

关键词

引用

@article{arxiv.2401.10475,
  title  = {CBVS: A Large-Scale Chinese Image-Text Benchmark for Real-World Short Video Search Scenarios},
  author = {Xiangshuo Qiao and Xianxin Li and Xiaozhe Qu and Jie Zhang and Yang Liu and Yu Luo and Cihang Jin and Jin Ma},
  journal= {arXiv preprint arXiv:2401.10475},
  year   = {2024}
}