基于跨模态原型对比的无监督声音-人脸表征学习
声音
2022-05-30 v3 计算机视觉与模式识别
多媒体
音频与语音处理
摘要
我们提出一种从说话人脸视频中学习声音-人脸表征的方法,无需任何身份标签。先前工作采用跨模态实例判别任务来建立声音与人脸的关联。这些方法忽略了不同视频的语义内容,将假负对作为训练噪声引入。此外,正对是基于音频片段与视觉帧之间的自然关联构建的。然而,在大量真实世界数据中这种关联可能较弱或不准确,导致偏离的正对进入对比范式。为解决这些问题,我们提出跨模态原型对比学习(CMPC),其利用对比方法的优势并抵抗假负对与偏离正对的不利影响。一方面,CMPC可通过在不同模态中无监督聚类构建语义级正对,从而学习类内不变性。另一方面,通过比较跨模态实例与跨模态原型之间的相似度,我们动态重新校准不可学习实例对总体损失的贡献。实验表明,所提方法在各种声音-人脸关联评估协议上优于最先进的无监督方法。此外,在低样本监督设定下,我们的方法相较先前的实例级对比学习也有显著提升。
引用
@article{arxiv.2204.14057,
title = {Unsupervised Voice-Face Representation Learning by Cross-Modal Prototype Contrast},
author = {Boqing Zhu and Kele Xu and Changjian Wang and Zheng Qin and Tao Sun and Huaimin Wang and Yuxing Peng},
journal= {arXiv preprint arXiv:2204.14057},
year = {2022}
}
备注
8 pages, 4 figures. Accepted by IJCAI-2022