中文

InvGC:基于逆图卷积的鲁棒跨模态检索

计算机视觉与模式识别 2023-10-26 v2 计算与语言 机器学习 多媒体

摘要

近几十年来,跨模态检索的重大进展主要由视觉与语言建模的突破所驱动。然而,近期一项研究表明,多模态数据表示倾向于在有限的凸锥内聚集(即表示退化问题),由于这些表示不可分,阻碍了检索性能。在我们的研究中,我们首先在多个跨模态基准与方法上实证验证了表示退化问题的存在。接下来,为应对该问题,我们引入一种称为 InvGC 的新方法,一种受图卷积与平均池化启发的后处理技术。具体而言,InvGC 在数据集内定义图拓扑,然后以相减方式应用图卷积。该方法通过增大数据点间距离有效分离表示。为提升 InvGC 的效率与有效性,我们提出一种进阶图拓扑 LocalAdj,其仅旨在增大每个数据点与其最近邻之间的距离。为理解 InvGC 生效的原因,我们给出详尽理论分析,证明部署 InvGC 后召回率的下界将得到改善。大量实证结果表明,InvGC 与带 LocalAdj 的 InvGC 显著缓解表示退化问题,从而提升检索性能。我们的代码见 https://github.com/yimuwangcs/Better_Cross_Modal_Retrieval

关键词

引用

@article{arxiv.2310.13276,
  title  = {InvGC: Robust Cross-Modal Retrieval by Inverse Graph Convolution},
  author = {Xiangru Jian and Yimu Wang},
  journal= {arXiv preprint arXiv:2310.13276},
  year   = {2023}
}

备注

Findings of EMNLP 2023