CREATE:面向中文短视频检索与标题生成的基准
计算机视觉与模式识别
2022-04-01 v1
摘要
以往的视频字幕工作旨在客观描述视频的实际内容,缺乏主观且吸引人的表达,限制了其实际应用场景。视频标题生成旨在实现这一目标,但缺乏合适的基准。本文中,我们提出 CREATE,首个大规模中文短视频检索与标题生成基准,以促进中文视频标题生成与视频检索的研究与应用。CREATE 包含一个高质量标注的 210K 数据集和两个大规模的 3M/10M 预训练数据集,覆盖 51 个类别、50K+ 标签、537K 人工标注的标题与字幕,以及 10M+ 短视频。基于 CREATE,我们提出一种新颖模型 ALWIG,其结合视频检索与视频标题生成任务,借助视频标签与 GPT 预训练模型实现多模态对齐与生成。CREATE 为推进中文短视频领域视频标题生成与视频检索的未来研究与应用开辟了新方向。
引用
@article{arxiv.2203.16763,
title = {CREATE: A Benchmark for Chinese Short Video Retrieval and Title Generation},
author = {Ziqi Zhang and Yuxin Chen and Zongyang Ma and Zhongang Qi and Chunfeng Yuan and Bing Li and Ying Shan and Weiming Hu},
journal= {arXiv preprint arXiv:2203.16763},
year = {2022}
}