从零到银标准:使用大语言模型创建专利-SDG分类可信训练数据的方法
计算与语言
2025-09-12 v1
摘要
将专利与联合国可持续发展目标(SDGs)的相关性进行分类对于追踪创新如何解决全球挑战至关重要。然而,缺乏大规模标注数据限制了监督学习的应用。现有方法,如关键词搜索、迁移学习和引用基准方法,缺乏可扩展性和可泛化性。本文将专利到SDG分类问题表述为弱监督问题,利用从专利引用到标记SDG科学出版物(NPL引用)的 citations 作为噪声初始信号。为了解决其稀疏性和噪声问题,我们开发了一种复合标注函数(LF),使用大语言模型(LLMs)从专利和SDG论文中提取结构化概念,即功能、解决方案和应用,基于专利本体。计算跨域相似性得分,并采用基于排名的检索方法进行组合。通过自定义的正样本损失函数对LF进行校准,该损失函数与已知的NPL-SDG链接一致,但不惩罚发现新的SDG关联。结果是一个银标准、软多标签数据集,将专利映射到SDG,从而 enables 对训练有效的多标签回归模型。我们通过两种互补策略进行验证:(1)针对保留的NPL-based标签的内部验证,其中我们的方法优于包括基于转换器的模型和零样本LLM的多个基线方法;(2)针对专利引用、共发明人和共申请人图的网络模块性的外部验证,其中我们的标签显示出比传统技术分类更大的主题性、认知性和组织性一致性。这些结果表明,弱监督和语义对齐可以按比例增强SDG分类。
引用
@article{arxiv.2509.09303,
title = {From scratch to silver: Creating trustworthy training data for patent-SDG classification using Large Language Models},
author = {Grazia Sveva Ascione and Nicolò Tamagnone},
journal= {arXiv preprint arXiv:2509.09303},
year = {2025}
}