中文

电影视频中的鲁棒角色标注:数据资源与自监督特征自适应

计算机视觉与模式识别 2022-03-01 v2 图像与视频处理

摘要

鲁棒的人脸聚类是实现对媒体中视觉角色刻画进行计算理解的关键步骤。长视频内容的人脸聚类具有挑战性,因为外观存在变化且缺乏支撑性的大规模标注数据。本文工作聚焦于该问题的两个关键方面:缺乏领域特定的训练或基准数据集,以及将网络图像上学习到的人脸嵌入自适应到长视频内容(具体而言是电影)。首先,我们提出一个包含超过169,000条人脸轨迹的数据集,这些轨迹精选自240部好莱坞电影,并带有关于一对人脸轨迹是否属于同一或不同角色的弱标签。我们提出一种基于嵌入空间中最近邻搜索的离线算法,从这些轨迹中挖掘困难样本。随后,我们研究了三元组损失和基于多视图相关性的方法,用于将人脸嵌入自适应到困难样本。我们的实验结果凸显了弱标签数据对领域特定特征自适应的有用性。总体而言,我们发现基于多视图相关性的自适应能产生更具判别力且更鲁棒的人脸嵌入。其在下游人脸验证和聚类任务上的表现可与该领域最先进(state-of-the-art)结果相媲美。我们还提出了用于扩充现有基准的SAIL-Movie角色基准语料库。它包含种族多元的演员,并提供人脸质量标签以用于后续误差分析。我们希望本工作开发的大规模数据集能进一步推进视频中的自动角色标注。所有资源可在 https://sail.usc.edu/~ccmi/multiface 免费获取。

关键词

引用

@article{arxiv.2008.11289,
  title  = {Robust Character Labeling in Movie Videos: Data Resources and Self-supervised Feature Adaptation},
  author = {Krishna Somandepalli and Rajat Hebbar and Shrikanth Narayanan},
  journal= {arXiv preprint arXiv:2008.11289},
  year   = {2022}
}