中文

衡量法律问答系统的扎根程度

计算与语言 2024-10-14 v1

摘要

在高风险领域如法律问答中,生成式AI系统的准确性和可信度至关重要。本工作提出了全面的多种方法基准,用于评估AI生成响应的扎根程度,以显著提升其可靠性。我们的实验包括基于相似性的指标和自然语言推理模型,以评估响应是否基于给定上下文。我们还探讨了针对大型语言模型的不同提示策略,以改善对不扎根响应的检测。我们使用新创建的扎根分类语料库验证了这些方法的有效性,该语料库专为法律查询及其对应的检索增强提示响应而设计,关注其与来源材料的一致性。结果表明,在生成响应的扎根程度分类方面存在潜力,最佳方法达到0.8的宏平均F1分数。此外,我们就方法的延迟进行评估,以确定其在实际应用中的适用性,因为该步骤通常随生成过程而后置。这一能力对于可能触发额外手动验证或自动响应再生成的过程至关重要。总之,本研究表明了各种检测方法在法律领域提升生成式AI可信度的潜力。

关键词

引用

@article{arxiv.2410.08764,
  title  = {Measuring the Groundedness of Legal Question-Answering Systems},
  author = {Dietrich Trautmann and Natalia Ostapuk and Quentin Grail and Adrian Alan Pol and Guglielmo Bonifazi and Shang Gao and Martin Gajek},
  journal= {arXiv preprint arXiv:2410.08764},
  year   = {2024}
}

备注

to appear NLLP @ EMNLP 2024