关于人脸与声音关联的学习
计算机视觉与模式识别
2018-11-05 v3
摘要
在本文中,我们研究人脸与人类声音之间的关联。视听整合,特别是面部与声音信息的整合,是神经科学中研究充分的领域。研究表明,两种模态间的重叠信息在说话人辨识等感知任务中起着重要作用。通过对我们创建的新数据集进行在线研究,我们确认了先前发现:人们能以高于随机水平的准确率将未见面孔与对应声音相关联,反之亦然。我们对面孔与声音之间的重叠信息进行计算建模,并表明所学到的跨模态表示包含足够的信息,以接近人类的性能识别匹配的面孔与声音。我们的表示展现出与某些人口统计属性以及仅从视觉或听觉单一模态获得的特征的相关性。我们发布了研究中使用的、由人朗读短文本所得的视听记录及人口统计标注数据集。
引用
@article{arxiv.1805.05553,
title = {On Learning Associations of Faces and Voices},
author = {Changil Kim and Hijung Valentina Shin and Tae-Hyun Oh and Alexandre Kaspar and Mohamed Elgharib and Wojciech Matusik},
journal= {arXiv preprint arXiv:1805.05553},
year = {2018}
}
备注
27 pages including the supplementary material; Accepted to ACCV 2018