中文

MoZIP:一个用于评估知识产权领域大语言模型的多语言基准

计算与语言 2024-02-27 v1 人工智能

摘要

大语言模型(LLMs)在各种自然语言处理(NLP)任务中展现了令人印象深刻的性能。然而,对于LLMs在特定领域(例如知识产权(IP)领域)的表现如何,目前了解有限。本文贡献了一个新的基准——首个面向多语言的知识产权问答基准(MoZIP),用于评估LLMs在IP领域的表现。MoZIP基准包括三个具有挑战性的任务:IP多项选择问答(IPQuiz)、IP问答(IPQA)和专利匹配(PatentMatch)。此外,我们还开发了一个新的面向IP的多语言大语言模型(称为MoZi),这是一个基于BLOOMZ的模型,经过多语言IP相关文本数据的监督微调。我们在MoZIP基准上评估了我们提出的MoZi模型和四个知名的LLMs(即BLOOMZ、BELLE、ChatGLM和ChatGPT)。实验结果表明,MoZi以显著优势优于BLOOMZ、BELLE和ChatGLM,但得分低于ChatGPT。值得注意的是,当前LLMs在MoZIP基准上的表现还有很大的提升空间,即使是最强大的ChatGPT也未达到及格水平。我们的源代码、数据和模型可在\url{https://github.com/AI-for-Science/MoZi}获取。

关键词

引用

@article{arxiv.2402.16389,
  title  = {MoZIP: A Multilingual Benchmark to Evaluate Large Language Models in Intellectual Property},
  author = {Shiwen Ni and Minghuan Tan and Yuelin Bai and Fuqiang Niu and Min Yang and Bowen Zhang and Ruifeng Xu and Xiaojun Chen and Chengming Li and Xiping Hu and Ye Li and Jianping Fan},
  journal= {arXiv preprint arXiv:2402.16389},
  year   = {2024}
}