中文

见声辨脸与听脸识声:跨模态生物特征匹配

计算机视觉与模式识别 2018-04-04 v2

摘要

我们引入一项看似不可能的任务:仅给定某人说话的音频片段,判断两张人脸图像中哪一张是该说话者。本文中我们研究此任务及若干相关的跨模态任务,旨在回答以下问题:从声音中能推断出关于人脸的哪些信息,反之亦然?我们在“真实场景”下研究该任务,采用当前公开可用的静态图像人脸识别数据集(VGGFace)和音频说话人识别数据集(VoxCeleb)。这些为跨模态匹配的静态与动态测试提供了训练与测试场景。我们的贡献如下:(i)我们提出了用于二分类与多分类跨模态人脸与音频匹配的 CNN 架构;(ii)我们比较了动态测试(有视频信息但音频并非来自同一视频)与静态测试(仅有一张静态图像);(iii)我们以人类测试作为基线来标定任务难度。我们表明,CNN 确实可在静态与动态场景下被训练以解决该任务,并且在给定声音进行人脸的 10 分类上明显优于随机猜测。在简单样本(如人脸性别不同)上 CNN 与人类表现相当,但在更具挑战性的样本(如性别、年龄和国籍均相同的人脸)上超越人类表现。

关键词

引用

@article{arxiv.1804.00326,
  title  = {Seeing Voices and Hearing Faces: Cross-modal biometric matching},
  author = {Arsha Nagrani and Samuel Albanie and Andrew Zisserman},
  journal= {arXiv preprint arXiv:1804.00326},
  year   = {2018}
}

备注

To appear in: IEEE Computer Vision and Pattern Recognition (CVPR), 2018