中文

分层多正样本对比学习用于专利图像检索

计算机视觉与模式识别 2025-06-23 v3 信息检索 机器学习

摘要

专利图像是传达专利创新信息的技术图纸。专利图像检索系统旨在在海量集合中搜索并检索最相关的图像。尽管信息检索领域近期取得了进展,但由于专利图像的技术复杂性和复杂的语义信息,仍面临重大挑战,需要高效的领域自适应微调。现有方法忽略了专利的分层关系,例如由洛迦诺国际分类(LIC)系统定义的关系,该系统将广泛类别(如"家具")分组为子类(如"座椅"和"床"),并进一步细分为具体的专利设计。在本工作中,我们提出了一种分层多正样本对比损失,利用LIC的分类体系在检索过程中诱导这种关系。我们的方法为批次中的每个专利图像分配多个正样本对,并根据分层分类体系赋予不同的相似度分数。我们在DeepPatent2数据集上对多种视觉和多模态模型进行的实验分析表明,所提出的方法提升了检索结果。值得注意的是,我们的方法在低参数模型上同样有效,这些模型需要更少的计算资源,可以部署在硬件受限的环境中。

关键词

引用

@article{arxiv.2506.13496,
  title  = {Hierarchical Multi-Positive Contrastive Learning for Patent Image Retrieval},
  author = {Kshitij Kavimandan and Angelos Nalmpantis and Emma Beauxis-Aussalet and Robert-Jan Sips},
  journal= {arXiv preprint arXiv:2506.13496},
  year   = {2025}
}

备注

5 pages, 3 figures, Accepted as a short paper at the 6th Workshop on Patent Text Mining and Semantic Technologies (PatentSemTech 2025), co-located with SIGIR 2025