中文

基于关系推理的跨模态映射通用模型

计算机视觉与模式识别 2021-03-01 v1

摘要

为匹配来自两种不同模态的一对实例,跨模态映射在计算机视觉界受到越来越多的关注。现有方法通常将映射函数公式化为嵌入到公共空间中的实例特征对之间的相似性度量。然而,我们观察到单一模态内实例之间的关系(类内关系)与异质实例对之间的关系(类间关系)在以往方法中未被充分探索。受此启发,我们通过图建模以关系推理重新定义映射函数,并进一步提出一种基于 GCN 的关系推理网络 (RR-Net),其中高效计算类间与类内关系以通用地解决跨模态映射问题。具体而言,我们首先构建两类图,即类内图与类间图,分别建模类内关系与类间关系。然后 RR-Net 以迭代方式更新所有节点特征与边特征,以同时学习类内与类间关系。最后,RR-Net 输出连接异质实例对的边上的概率以估计映射结果。在图像分类、社交推荐与声音识别三个示例任务上的大量实验清楚地展示了我们所提模型的优越性与通用性。

关键词

引用

@article{arxiv.2102.13360,
  title  = {A Universal Model for Cross Modality Mapping by Relational Reasoning},
  author = {Zun Li and Congyan Lang and Liqian Liang and Tao Wang and Songhe Feng and Jun Wu and Yidong Li},
  journal= {arXiv preprint arXiv:2102.13360},
  year   = {2021}
}

备注

10 pages, 4 figures