中文

将大语言模型条件化于法律系统?可惩罚仇恨言论检测

计算与语言 2025-06-04 v1 人工智能

摘要

对法律问题的评估需要考虑特定的法律体系及其抽象层级,从宪法到成文法再到判例法。大语言模型(LLM)在多大程度上内化了此类法律体系尚属未知。在本文中,我们提出并研究了在法律体系的不同抽象层级上对 LLM 进行条件化的不同方法。本文检验了在法律体系的多个抽象层级上对 LLM 进行条件化的不同方法,以检测可能受惩罚的仇恨言论。我们专注于一项分类任务,即判断特定的社交媒体帖子是否属于德国刑法所规定的煽动仇恨罪。结果表明,无论模型在何种抽象层级上进行条件化,模型与法律专家在仇恨言论的法律评估上仍存在显著的性能差距。我们的分析显示,在抽象法律知识上进行条件化的模型缺乏深层的任务理解,经常自相矛盾并产生幻觉答案,而使用具体法律知识的模型在识别相关目标群体方面表现合理,但在对目标行为进行分类时却遇到困难。

关键词

引用

@article{arxiv.2506.03009,
  title  = {Conditioning Large Language Models on Legal Systems? Detecting Punishable Hate Speech},
  author = {Florian Ludwig and Torsten Zesch and Frederike Zufall},
  journal= {arXiv preprint arXiv:2506.03009},
  year   = {2025}
}