探寻声音之形:一种学习语音-人脸关联的自适应框架
计算机视觉与模式识别
2021-03-15 v1
摘要
如今,我们已见证了自动学习语音与人脸之间关联的初步进展,这为计算机视觉界带来了新一轮的研究浪潮。然而,此前该方向的大部分工作(a)仅采用局部信息进行模态对齐,且(b)忽略了不同主体间学习难度的差异性。本文提出一种新颖框架,联合解决上述两个问题。针对(a),我们提出一种考虑全局与局部信息的二级模态对齐损失。与现有方法相比,我们在模态对齐过程中引入了全局损失。该损失的全局部分由身份分类驱动。理论上,我们证明最小化该损失可在全局意义下(而非小批量意义下)最大化不同身份嵌入之间的距离,同时最小化同一身份嵌入之间的距离。针对(b),我们提出一种动态重加权方案,以更好地挖掘困难但有价值的身份,同时过滤掉不可学习的身份。实验表明,所提方法在语音-人脸匹配、验证与检索等多种设定下均优于先前方法。
引用
@article{arxiv.2103.07293,
title = {Seeking the Shape of Sound: An Adaptive Framework for Learning Voice-Face Association},
author = {Peisong Wen and Qianqian Xu and Yangbangyan Jiang and Zhiyong Yang and Yuan He and Qingming Huang},
journal= {arXiv preprint arXiv:2103.07293},
year = {2021}
}