地点至关重要:比较基于地点的法律查询中大语言模型的幻觉率
计算机与社会
2025-11-11 v1 人工智能
计算与语言
摘要
如何有意义地比较大语言模型在一个地方与另一个地方的法律知识?量化这些差异对于理解基于LLM的聊天机器人用户获得的法律信息质量是否因地点而异至关重要。然而,获得有意义的比较指标具有挑战性,因为不同地方法律机构本身不易比较。在这项工作中,我们提出了一种基于比较法功能主义概念来获得地点间指标的方法。我们构建了一个事实场景数据集,这些场景来自Reddit上寻求家庭、住房、就业、犯罪和交通问题法律建议的用户帖子。我们利用这些场景来引发LLM对洛杉矶、伦敦和悉尼每个场景相关法律的摘要。这些摘要(通常是立法条款)被人工评估是否存在幻觉。我们表明,领先的闭源LLM的法律信息幻觉率与地点显著相关。这表明这些模型提供的法律解决方案的质量在地理上并非均匀分布。此外,我们展示了幻觉率与LLM多次采样时多数响应频率之间存在强烈的负相关,这表明模型对法律事实预测的不确定性度量。
引用
@article{arxiv.2511.06700,
title = {Place Matters: Comparing LLM Hallucination Rates for Place-Based Legal Queries},
author = {Damian Curran and Vanessa Sporne and Lea Frermann and Jeannie Paterson},
journal= {arXiv preprint arXiv:2511.06700},
year = {2025}
}