中文

Panda-70M:利用多跨模态教师模型为 7000 万视频生成字幕

计算机视觉与模式识别 2024-03-01 v1

摘要

数据和标注的质量决定了下游模型质量的上限。虽然存在大型文本语料库和图像 - 文本对,但高质量的视频 - 文本数据更难收集。首先,人工标注更耗时,因为它需要标注员观看整个视频。其次,视频具有时间维度,由多个场景堆叠而成并展示多种动作。因此,为了建立具有高质量字幕的视频数据集,我们提出了一种利用多模态输入(如文本视频描述、字幕和单个视频帧)的自动方法。具体而言,我们从公开可用的 HD-VILA-100M 数据集中精选了 380 万个高分辨率视频。我们将它们分割成语义一致的视频片段,并应用多个跨模态教师模型为每个视频获取字幕。接下来,我们在一个小子集上微调检索模型,该子集中每个视频的最佳字幕已由人工选定,然后将该模型应用于整个数据集以选择最佳字幕作为标注。通过这种方式,我们获得了 7000 万个 paired 高质量文本字幕的视频。我们将该数据集命名为 Panda-70M。我们在三个下游任务中展示了所提出数据集的价值:视频字幕生成、视频与文本检索以及文本驱动的视频生成。在 proposed 数据上训练的模型在所有任务的大多数指标上得分显著更高。

关键词

引用

@article{arxiv.2402.19479,
  title  = {Panda-70M: Captioning 70M Videos with Multiple Cross-Modality Teachers},
  author = {Tsai-Shien Chen and Aliaksandr Siarohin and Willi Menapace and Ekaterina Deyneka and Hsiang-wei Chao and Byung Eun Jeon and Yuwei Fang and Hsin-Ying Lee and Jian Ren and Ming-Hsuan Yang and Sergey Tulyakov},
  journal= {arXiv preprint arXiv:2402.19479},
  year   = {2024}
}

备注

CVPR 2024. Project Page: https://snap-research.github.io/Panda-70M