中文

M-VAD Names:一个用于带命名视频字幕的数据集

计算机视觉与模式识别 2019-03-06 v1

摘要

当前的电影字幕架构无法用恰当的名字提及角色,而是用通用的“someone”标签替代。缺乏带有角色视觉标注的电影描述数据集无疑在这一不足中起了重要作用。最近,我们提出通过引入此类信息来扩展 M-VAD 数据集。在本文中,我们提出了该数据集的改进版本,即 M-VAD Names,及其半自动标注流程。所得数据集包含 63k 个视觉轨迹和 34k 个文本提及,均与角色身份相关联。为展示该数据集的特征并量化命名任务的复杂性,我们研究了多模态架构,以用恰当的角色名替换现有视频字幕中的“someone”标签。评估进一步通过在该数据集之外的视频上测试此应用而扩展。

关键词

引用

@article{arxiv.1903.01489,
  title  = {M-VAD Names: a Dataset for Video Captioning with Naming},
  author = {Stefano Pini and Marcella Cornia and Federico Bolelli and Lorenzo Baraldi and Rita Cucchiara},
  journal= {arXiv preprint arXiv:1903.01489},
  year   = {2019}
}

备注

Source Code: https://github.com/aimagelab/mvad-names-dataset - Video Demo: https://youtu.be/dOvtAXbOOH4