中文

DesignCLIP:用于设计专利理解的多模态学习框架

计算机视觉与模式识别 2025-08-22 v1 人工智能

摘要

在设计专利分析领域,传统任务如专利分类和专利图像检索严重依赖图像数据。然而,专利图像——通常由构成发明抽象和结构元素的数据——不足以传达完整的视觉上下文和语义信息,这可能导致先前文献搜索中的评估模糊不清。近期视觉语言模型(如 CLIP)的发展为更可靠、准确的 AI 驱动专利分析提供了前景。在本工作中,我们利用 CLIP 模型开发了一个统一框架 DesignCLIP,用于设计专利应用,同时构建了大规模美国设计专利数据集。为address专利数据的独特特征,DesignCLIP 融合了类别感知分类和对比学习,利用为专利图像生成的详细描述和多视角图像学习。我们在各种下游任务上验证了 DesignCLIP 的有效性,包括专利分类和专利检索。此外,我们探索了多模态专利检索,这为通过提供更丰富的灵感来源来增强创造力和创新提供了潜力。我们的实验表明,DesignCLIP 在专利领域的所有任务上均 consistently 优于基准和 SOTA 模型。我们的发现凸显了多模态方法在推动专利分析方面的潜力。代码已提供:https://anonymous.4open.science/r/PATENTCLIP-4661/README.md。

关键词

引用

@article{arxiv.2508.15297,
  title  = {DesignCLIP: Multimodal Learning with CLIP for Design Patent Understanding},
  author = {Zhu Wang and Homaira Huda Shomee and Sathya N. Ravi and Sourav Medya},
  journal= {arXiv preprint arXiv:2508.15297},
  year   = {2025}
}

备注

Accepted by EMNLP 2025. 22 pages, 14 figures