中文

iQIYI-VID:一个用于多模态人物识别的大规模数据集

计算机视觉与模式识别 2019-04-23 v2

摘要

真实场景下的人物识别由于姿态、人脸质量、衣着、妆容等方面的巨大变化而非常具有挑战性。传统研究,如人脸识别、行人重识别以及说话人识别,往往聚焦于单一模态信息,不足以应对实践中的所有情况。多模态人物识别是一种更有前景的方式,我们可以联合利用人脸、头部、身体、音频特征等。在本文中,我们介绍 iQIYI-VID,最大的用于多模态人物识别的视频数据集。它由 5000 位名人的 600K 视频片段组成。这些视频片段从 400K 小时的各种类型在线视频中提取,涵盖电影、综艺节目、电视剧到新闻播报。所有视频片段均经过细致的人工标注过程,标签错误率低于 0.2%。我们在 iQIYI-VID 数据集上评估了人脸识别、行人重识别和说话人识别的先进模型。实验结果表明,这些模型对于真实场景下的人物识别任务仍远非完美。我们提出了一种多模态注意力模块来融合多模态特征,可显著改善人物识别。我们已在线发布该数据集以促进多模态人物识别研究。

关键词

引用

@article{arxiv.1811.07548,
  title  = {iQIYI-VID: A Large Dataset for Multi-modal Person Identification},
  author = {Yuanliu Liu and Bo Peng and Peipei Shi and He Yan and Yong Zhou and Bing Han and Yi Zheng and Chao Lin and Jianbin Jiang and Yin Fan and Tingwei Gao and Ganwen Wang and Jian Liu and Xiangju Lu and Danming Xie},
  journal= {arXiv preprint arXiv:1811.07548},
  year   = {2019}
}