中文

基于字幕视频的自包含实体发现

计算机视觉与模式识别 2022-08-16 v1

摘要

本文提出一种无需任务特定监督或任务特定外部知识源的视觉命名实体发现任务。为视频帧中的实体(如人脸、场景或物体)赋予具体名称是一个长期存在的挑战。通常,该问题被作为监督学习目标,通过人工标注人脸与实体标签来解决。为规避此设定下的标注负担,若干工作利用电影数据库等外部知识源来研究该问题。虽有效,但此类方法在缺乏任务特定知识源时无法工作,且只能应用于电影和电视剧。本文将问题推进一步,提出从视频及相应字幕或台词中发现视频中的实体。我们提出一种三阶段方法:1)从帧-字幕对构建二部实体-名称图;2)寻找视觉实体一致性;3)通过实体级原型构建细化实体分配。为应对这一新问题,我们基于《老友记》和《生活大爆炸》剧集构建了 SC-Friends 和 SC-BBT 两个新基准。在基准上的实验证明了我们的方法仅从视频中的多模态信息即可发现哪个命名实体属于哪张人脸或场景,准确率接近监督式 oracle。此外,我们的定性示例展示了未来工作中自包含发现任意视觉实体的潜在挑战。代码与数据已发布于 GitHub。

关键词

引用

@article{arxiv.2208.06662,
  title  = {Self-Contained Entity Discovery from Captioned Videos},
  author = {Melika Ayoughi and Pascal Mettes and Paul Groth},
  journal= {arXiv preprint arXiv:2208.06662},
  year   = {2022}
}