中文

基于成对约束的跨模态学习

计算机视觉与模式识别 2023-07-19 v1

摘要

在多媒体应用中,Web 文档中的文本和图像组件构成了一个成对约束,该约束可能指示相同的语义概念。本文研究了基于成对约束的跨模态学习,旨在发现不同模态中隐藏的公共结构。我们首先提出了一种复合正则化框架来处理成对约束,该框架可作为开发跨模态算法的通用平台。针对无监督学习,我们提出了一种跨模态子空间聚类方法,以学习不同模态的公共结构。针对有监督学习,为了减小成对约束中的语义差距和异常值,我们提出了一种基于复合 2,1\ell_{2,1} 正则化的跨模态匹配方法,并结合迭代重加权算法以寻找全局最优解。大量实验证明了利用语义诱导的成对约束进行联合文本和图像建模的优势,并表明所提出的跨模态方法能够进一步减小不同模态间的语义差距,提高聚类和检索精度。

关键词

引用

@article{arxiv.1411.7798,
  title  = {Cross-Modal Learning via Pairwise Constraints},
  author = {Ran He and Man Zhang and Liang Wang and Ye Ji and Qiyue Yin},
  journal= {arXiv preprint arXiv:1411.7798},
  year   = {2023}
}

备注

12 pages, 5 figures, 70 references