IPEval:面向大型语言模型的双语知识产权代理咨询评估基准
计算与语言
2024-06-19 v1
摘要
大型语言模型(LLMs)在垂直领域的快速发展缺乏针对其理解、应用和推理能力的特定评估基准。为填补这一空白,我们引入 IPEval,即面向知识产权(IP)代理和咨询任务的首个评估基准。IPEval 包含 2657 题的多选问答,涵盖创作、应用、保护和管理四大维度。这些问题涉及专利权(发明、实用新型、设计)、商标、版权、商业秘密及其他相关法律。评估方法包括零样本、5-shot 和链式思考(Chain of Thought, CoT),适用于七种 LLM 类型,主要以英文或中文进行。结果表明,GPT 系列和 Qwen 系列模型在英文测试中表现优异,而以中文为主的模型在中文测试中表现更佳,尽管专业 IP LLM 仍落后于通用型 LLM。知识产权的地域性和时效性凸显了 LLM 捕捉法律细微差别和法律演变的必要性。IPEval 旨在准确评估 LLM 在知识产权领域的能力,并推动开发专业模型。网站:\url{https://ipeval.github.io/}。
引用
@article{arxiv.2406.12386,
title = {IPEval: A Bilingual Intellectual Property Agency Consultation Evaluation Benchmark for Large Language Models},
author = {Qiyao Wang and Jianguo Huang and Shule Lu and Yuan Lin and Kan Xu and Liang Yang and Hongfei Lin},
journal= {arXiv preprint arXiv:2406.12386},
year = {2024}
}