中文

J&H:评估大型语言模型在法律领域面临知识注入攻击下的鲁棒性

计算与语言 2025-03-25 v1

摘要

随着大型语言模型(LLM)的规模和能力不断提升,其在知识密集型领域如法律领域的应用日益广泛。然而,是否这些LLM基于领域知识进行推理判断仍存疑虑。如果LLM的判断仅基于特定词语或模式,而非语言的底层逻辑,其“LLM-as-judges”范式在实际应用中可能带来重大风险。为回答此问题,本文提出了一种用于鲁棒性测试的法律知识注入攻击方法,从而推断LLM是否学习了法律知识和推理逻辑。本文提出J&H框架,用于检测大型语言模型在法律领域知识注入攻击下的鲁棒性。该框架旨在探讨LLM在完成法律任务时是否进行演绎推理。为进一步实现此目标,我们针对这些任务所包含的推理逻辑的各个部分(主要前提、次要前提和结论生成)进行了攻击。我们收集了法律专家在司法决策中可能犯下的错误,如拼写错误、法律同义词、不准确的外部法律法规检索。然而,在实际司法实践中,法律专家倾向于忽略这些错误,基于逻辑作出判断。然而,在面对这些错误时,LLM可能被拼写错误误导,未在判断中运用逻辑。我们对现有的通用和领域特定LLM进行了知识注入攻击。实验中的现有LLM在我们所采用的方法下鲁棒性不足。此外,我们还提出了若干方法来增强LLM的知识鲁棒性。

关键词

引用

@article{arxiv.2503.18360,
  title  = {J&H: Evaluating the Robustness of Large Language Models Under Knowledge-Injection Attacks in Legal Domain},
  author = {Yiran Hu and Huanghai Liu and Qingjing Chen and Ning Zheng and Chong Wang and Yun Liu and Charles L. A. Clarke and Weixing Shen},
  journal= {arXiv preprint arXiv:2503.18360},
  year   = {2025}
}

备注

10 pages, 5 figures