中文

基于大型视觉语言模型的专利图 figure 分类

信息检索 2025-01-23 v1 计算机视觉与模式识别 机器学习

摘要

专利图 figure 分类通过实现专利检索系统中的分面检索,使高效的先验文献检索成为可能。现有方法仅针对单个方面或概念数量有限的方面探索了专利图 figure 分类。近年来,大型视觉语言模型(LVLMs)在众多计算机视觉下游任务中显示出惊人的性能,但在专利图 figure 分类领域仍未得到探索。我们的工作聚焦于LVLMs在专利图 figure 视觉问答(VQA)和分类中的应用,特别关注零样本和少样本学习场景。为此,我们引入了新的数据集PatFigVQA和PatFigCLS,用于针对专利图 figure的多个方面(即类型、投影、专利类别和对象)进行微调和评估。为了高效处理大量类别,我们提出了一种新颖的锦标赛式分类策略,该策略利用一系列多选问题。实验结果和多种基于LVLMs和卷积神经网络(CNNs)的分类方法在少样本设置下的比较表明,所提出的方法是可行的。

关键词

引用

@article{arxiv.2501.12751,
  title  = {Patent Figure Classification using Large Vision-language Models},
  author = {Sushil Awale and Eric Müller-Budack and Ralph Ewerth},
  journal= {arXiv preprint arXiv:2501.12751},
  year   = {2025}
}