中文

音视觉亲属关系验证

计算机视觉与模式识别 2019-06-25 v1

摘要

视觉亲属关系验证旨在确认给定一对图像或视频中的两个人是否共享假设的亲属关系。作为广义的人脸验证任务,视觉亲属关系验证在低质量互联网数据中尤为困难。由于背景、姿态、面部表情、模糊、光照与遮挡的不可控变化,最先进的方法无法提供高水平的识别准确率。与许多其他视觉识别任务一样,亲属关系验证可能受益于视觉与音频信号的结合。然而,基于声音的亲属关系验证此前极少受到关注。我们假设人声包含与视觉线索互补的亲属相关线索。在本文中,我们首次探讨利用来自人脸与声音模态的音视觉信息进行亲属关系验证。我们首先提出一个新的多模态亲属关系数据集,称为 TALking KINship(TALKIN),其包含若干对互联网质量的视频序列。利用 TALKIN,我们随后研究了多种亲属关系验证方法的效用,包括传统的基于局部特征的方法、统计方法以及较新的深度学习方法。接着,在 TALKIN 数据集上评估了早期与晚期融合方法,以研究兼具人脸与声音模态的亲属关系验证。最后,我们提出一种具有对比损失的深度 Siamese 融合网络用于亲属关系的多模态融合。在 TALKIN 数据集上的大量实验表明,通过结合人脸与声音模态,所提 Siamese 网络可提供比基线单模态与多模态融合技术显著更高的准确率。实验结果还表明,音频(人声)信息是对面部信息互补且有助于亲属关系验证的。

关键词

引用

@article{arxiv.1906.10096,
  title  = {Audio-Visual Kinship Verification},
  author = {Xiaoting Wu and Eric Granger and Xiaoyi Feng},
  journal= {arXiv preprint arXiv:1906.10096},
  year   = {2019}
}

备注

12 pages