中文

腾讯 AVS:面向多模态场景分割的整体广告视频数据集

计算机视觉与模式识别 2022-12-12 v1

摘要

近年来,时序视频分割与分类因公共基准而取得巨大进展。然而,此类研究仍主要聚焦于人体动作,未能以整体视角描述视频。此外,以往研究往往过于关注视觉信息而忽略视频的多模态本质。为填补这一空白,我们构建了广告领域的腾讯“广告视频分割”~(TAVS) 数据集,将多模态视频分析提升至新高度。TAVS 从“呈现形式”、“地点”和“风格”三个独立视角描述视频,并包含视频、音频和文本等丰富的多模态信息。TAVS 在语义层面以层次化组织,用于全面的时序视频分割,具有三级类别供多标签分类,例如“地点”–“工作地点”–“办公室”。因此,TAVS 因其多模态信息、类别的整体视角和层次化粒度而区别于以往的时序分割数据集。它包含 12,000 个视频、82 个类别、33,900 个片段、121,100 个镜头和 168,500 个标签。随 TAVS 一同,我们还提出了一个结合多标签类别预测的强大多模态视频分割基线。我们进行了大量实验来评估所提方法以及现有代表性方法,以揭示数据集 TAVS 的关键挑战。

关键词

引用

@article{arxiv.2212.04700,
  title  = {Tencent AVS: A Holistic Ads Video Dataset for Multi-modal Scene Segmentation},
  author = {Jie Jiang and Zhimin Li and Jiangfeng Xiong and Rongwei Quan and Qinglin Lu and Wei Liu},
  journal= {arXiv preprint arXiv:2212.04700},
  year   = {2022}
}