中文

缺口还是幻觉?细粒度文本评估中的机器生成法律分析探讨

计算与语言 2024-09-25 v2 计算机与社会

摘要

大型语言模型(LLM)在作为从事法律分析专业人士的写作辅助工具方面显示出巨大的潜力。然而,LLM 在此场景下常会产生难以被非专业人士和现有文本评估指标识别的幻觉现象。本文提出关键问题:机器生成的法律分析何时才能被视为可接受的评估结果?我们引入一种中性概念——缺口(gaps),以区别于严格意义上的错误幻觉,指人类撰写与机器生成法律分析之间的差异。缺口并不总是等同于无效的生成结果。我们与法律专家合作,围绕Hou等人(2024b)提出的CLERC生成任务展开研究,构建了一套分类体系、用于预测缺口类别的细粒度检测器,以及用于自动评估的标注数据集。我们的最佳检测器在测试集上实现了67%的F1分数和80%的精确率。将该检测器作为自动化指标应用于SOTA LLM生成的法律分析,我们发现约80%包含不同类型的幻觉现象。

关键词

引用

@article{arxiv.2409.09947,
  title  = {Gaps or Hallucinations? Gazing into Machine-Generated Legal Analysis for Fine-grained Text Evaluations},
  author = {Abe Bohan Hou and William Jurayj and Nils Holzenberger and Andrew Blair-Stanek and Benjamin Van Durme},
  journal= {arXiv preprint arXiv:2409.09947},
  year   = {2024}
}