中文

人脸、身体、声音:基于多模态的视频人物聚类

计算机视觉与模式识别 2021-05-21 v1

摘要

本工作的目标是视频中的人物聚类——根据身份对角色进行分组。先前的方法聚焦于较窄的人脸聚类任务,且在大多数情况下忽略其他线索,如人的声音、整体外观(头发、衣服、姿态)以及视频的剪辑结构。类似地,大多数当前数据集仅评估人脸聚类任务,而非人物聚类。这限制了它们在诸如故事理解等需要人物级而非仅人脸级推理的下游应用中的适用性。在本文中,我们做出贡献以解决这两方面的不足:首先,我们引入一种多模态高精度聚类算法,利用来自多个模态(人脸、身体和声音)的线索进行视频人物聚类。其次,我们引入一个视频人物聚类数据集,用于评估多模态人物聚类。它包含每个标注角色的身体轨迹、可见时的人脸轨迹以及说话时的声音轨迹及其关联特征。该数据集是迄今为止同类中最大的,涵盖代表广泛人口统计特征的电影和电视剧。最后,我们展示了利用多模态进行人物聚类的有效性,探索了这一新广泛任务通过角色共现用于故事理解的应用,并在所有人脸和人物聚类的可用数据集上达到了新的 SOTA。

关键词

引用

@article{arxiv.2105.09939,
  title  = {Face, Body, Voice: Video Person-Clustering with Multiple Modalities},
  author = {Andrew Brown and Vicky Kalogeiton and Andrew Zisserman},
  journal= {arXiv preprint arXiv:2105.09939},
  year   = {2021}
}