LeKUBE:面向法律知识更新的基准测试
计算与语言
2024-11-13 v2 人工智能
摘要
近期大型语言模型(LLM)的快速发展显著推动了人工智能在多个领域的应用,包括法律智能研究。基于大量法律文本(包括法规和法律文件)训练的法律LLM能够有效捕捉重要的法律知识与概念,为下游法律应用(如法律咨询)提供重要支持。然而,法律法规及其解释的动态性也为LLM在法律应用中带来新挑战。尤其是如何有效且高效地更新LLM的法律知识,已成为实践中的重要研究问题。现有用于评估知识更新方法的基准测试大多面向开放域,无法针对法律领域的特定挑战进行评估,包括法律知识细致应用、法律法规的复杂性与冗长性,以及法律推理的精妙性。为填补这一空白,我们提出了法律知识更新基准测试(Legal Knowledge Update BEnchmark,即LeKUBE),其在五个维度上评估法律LLM的知识更新方法。具体而言,我们在法律专业人士的帮助下,对法律领域的知识更新需求进行分类,然后聘请法学院的标注员创建针对中国刑法和民法典的人工合成更新,以及一组更新后答案将发生变化的问题。通过对现有先进知识更新方法的全面评估,我们发现现有知识更新方法与法律领域独特需求之间存在显著差距,强调需进一步研发针对法律LLM的知识更新机制。
引用
@article{arxiv.2407.14192,
title = {LeKUBE: A Legal Knowledge Update BEnchmark},
author = {Changyue Wang and Weihang Su and Hu Yiran and Qingyao Ai and Yueyue Wu and Cheng Luo and Yiqun Liu and Min Zhang and Shaoping Ma},
journal= {arXiv preprint arXiv:2407.14192},
year = {2024}
}