面向知识产权领域的大语言模型基准测试:IPBench
计算与语言
2025-09-30 v2 人工智能
摘要
知识产权 (IP) 是一种高度专业化的领域,融合了技术与法律知识,具有内在的复杂性和知识密集性。最近的 LLM 进展已展示了其处理 IP 相关任务的潜力,使能够更有效地分析、理解和生成 IP 相关内容。然而,现有数据集和基准测试仅聚焦于专利或涵盖 IP 领域的有限方面,缺乏与实际场景的对齐。为弥合这一差距,我们引入 IPBench,首个涵盖 8 种 IP 机制和 20 种不同任务的综合性 IP 任务分类学和大规模双语基准测试,旨在评估 LLM 在实际 IP 场景中的表现。我们对 17 项主要 LLM 进行基准测试,从通用模型到特定领域模型,包括面向对话和推理导向的模型,在零-shot、few-shot 和链路思考设置下进行测试。我们的结果表明,即使是表现最佳的模型 DeepSeek-V3 也仅达到 75.8% 的准确率,仍有显著的提升空间。值得注意的是,开源的 IP 和法律导向模型在表现上落后于闭源通用模型。为促进未来研究,我们公开发布 IPBench,并将进一步扩展其任务以更好地反映实际复杂度并支持模型在 IP 领域的进步。我们提供 supplementary URLs 中的数据和代码。
引用
@article{arxiv.2504.15524,
title = {IPBench: Benchmarking the Knowledge of Large Language Models in Intellectual Property},
author = {Qiyao Wang and Guhong Chen and Hongbo Wang and Huaren Liu and Minghui Zhu and Zhifei Qin and Linwei Li and Yilin Yue and Shiqiang Wang and Jiayan Li and Yihang Wu and Ziqiang Liu and Longze Chen and Run Luo and Liyang Fan and Jiaming Li and Lei Zhang and Kan Xu and Chengming Li and Hamid Alinejad-Rokny and Shiwen Ni and Yuan Lin and Min Yang},
journal= {arXiv preprint arXiv:2504.15524},
year = {2025}
}
备注
71 pages, 75 figures, 53 tables