面向人脸-声音关联的分支融合与正交投影学习
计算机视觉与模式识别
2022-08-23 v1
摘要
近年来,利用YouTube中的视听信息建立名人脸孔与声音之间关联的兴趣日益增长。先前工作采用度量学习方法学习适用于关联匹配与验证任务的嵌入空间。尽管取得一定进展,此类形式因依赖于距离相关间隔参数、训练时运行复杂度高以及依赖精心设计的负样本挖掘过程而具局限性。本工作中,我们假设丰富的表示与有效且高效监督对于实现人脸-声音关联任务的判别联合嵌入空间至关重要。为此,我们提出一种轻量、即插即用机制,利用两模态中的互补线索形成丰富的融合嵌入,并基于正交性约束按其身份标签聚类。我们将所提机制称为融合与正交投影(fusion and orthogonal projection, FOP),并在双流网络中实例化。最终框架在VoxCeleb1与MAV-Celeb数据集上以包括跨模态验证与匹配在内的多种任务进行评估。结果显示,我们的方法优于当前SOTA方法,且所提监督形式比现有方法采用的更高效有效。此外,我们利用跨模态验证与匹配任务分析了多语言对人脸-声音关联的影响。代码见:\url{https://github.com/msaadsaeed/FOP}
引用
@article{arxiv.2208.10238,
title = {Learning Branched Fusion and Orthogonal Projection for Face-Voice Association},
author = {Muhammad Saad Saeed and Shah Nawaz and Muhammad Haris Khan and Sajid Javed and Muhammad Haroon Yousaf and Alessio Del Bue},
journal= {arXiv preprint arXiv:2208.10238},
year = {2022}
}
备注
Submitted: IEEE Transactions on Multimedia. arXiv admin note: substantial text overlap with arXiv:2112.10483