中文

用于声音与面孔跨模态匹配的不相交映射网络

计算机视觉与模式识别 2018-07-17 v2

摘要

我们提出一种称为不相交映射网络(DIMNet)的新框架,用于跨模态生物特征匹配,特别是声音与面孔的匹配。与现有方法不同,DIMNet不显式学习模态间的联合关系。相反,DIMNet通过将不同模态分别映射到其共同协变量来学习它们的共享表示。这些共享表示随后可用于寻找模态间的对应关系。我们通过实验表明,DIMNet能够取得优于其他当前方法的性能,并具有概念更简单和更少数据依赖的额外优势。

关键词

引用

@article{arxiv.1807.04836,
  title  = {Disjoint Mapping Network for Cross-modal Matching of Voices and Faces},
  author = {Yandong Wen and Mahmoud Al Ismail and Weiyang Liu and Bhiksha Raj and Rita Singh},
  journal= {arXiv preprint arXiv:1807.04836},
  year   = {2018}
}

备注

Tech report