中文

APES:未裁剪视频中的视听人物检索

计算机视觉与模式识别 2021-06-04 v1

摘要

人类可以说是视频流中最重要的主体之一,许多现实世界的应用(如视频摘要或视频编辑工作流)常常需要自动搜索并检索感兴趣的人物。尽管在行人重识别与检索领域已有大量努力,但很少有工作提出视听搜索策略。在本文中,我们提出视听人物检索数据集(APES),这是一个由未裁剪视频组成的新数据集,其音频(人声)与视觉(人脸)流均经过密集标注。APES 包含超过 1.9K 个身份,标注于 36 小时视频中,使其成为当前可用于未裁剪视听人物检索的最大数据集。APES 的一个关键特性是包含将人脸与同一身份语音片段相关联的密集时间标注。为展示我们新数据集的潜力,我们提出一种视听基线及人物检索基准。我们的研究表明,对视听线索进行建模有助于人物身份的识别。为促进可复现性与推动未来研究,数据集标注与基线代码发布于:https://github.com/fuankarion/audiovisual-person-search

关键词

引用

@article{arxiv.2106.01667,
  title  = {APES: Audiovisual Person Search in Untrimmed Video},
  author = {Juan Leon Alcazar and Long Mai and Federico Perazzi and Joon-Young Lee and Pablo Arbelaez and Bernard Ghanem and Fabian Caba Heilbron},
  journal= {arXiv preprint arXiv:2106.01667},
  year   = {2021}
}