中文

融合与正交投影用于改进的人脸-声音关联学习

计算机视觉与模式识别 2021-12-21 v1

摘要

我们研究人脸与声音之间关联学习的问题,该问题近来在计算机视觉界受到关注。先前工作采用成对或三元组损失形式来学习适用于关联匹配与验证任务的嵌入空间。尽管取得了一定进展,此类损失形式由于依赖于距离相关边界参数、训练时运行复杂度高,以及依赖精心设计的负样本挖掘过程而存在局限性。在本工作中,我们假设丰富的特征表示与有效且高效监督的结合,对于实现用于改进人脸-声音关联的判别性联合嵌入空间是必要的。为此,我们提出一种轻量、即插即用的机制,利用两种模态中的互补线索形成丰富的融合嵌入,并基于身份标签通过正交约束对其进行聚类。我们将所提机制称为融合与正交投影(FOP),并在双流流水线中实例化。整体所得框架在大规模 VoxCeleb 数据集上以多种任务(包括跨模态验证与匹配)进行了评估。结果表明,我们的方法优于当前最先进(SOTA)方法,且所提监督形式比现有方法采用的监督更有效且更高效。

关键词

引用

@article{arxiv.2112.10483,
  title  = {Fusion and Orthogonal Projection for Improved Face-Voice Association},
  author = {Muhammad Saad Saeed and Muhammad Haris Khan and Shah Nawaz and Muhammad Haroon Yousaf and Alessio Del Bue},
  journal= {arXiv preprint arXiv:2112.10483},
  year   = {2021}
}