请老朋友:诊断和缓解基于LLM的法律条文问答中的时序失效模式
计算与语言
2026-05-25 v1
摘要
大型语言模型正在被广泛用于法律研究,但其固定的训练截止日期和依赖于静态参数知识的做法,与法律条文不断演变的本质相矛盾。我们研究了两种时序失效模式:超出截止日期的陈旧化,即模型在立法修订后仍应用已被废止的规则;以及近期偏见,即模型倾向于优先选择更新的条文,即使历史版本才适用于事实情形。为此,我们构建了一个包含312个专家验证的、时序敏感的德国法律条文问答基准,涵盖三个类别:超出截止日期的修订问题、修订前问题以及多条款修订前问题。我们评估了来自OpenAI、Anthropic和DeepSeek的五个LLM,在四种推理设置下表现:Vanilla、Web搜索和两种通过事实日期提取和版本过滤强制时序有效性的检索增强变体。使用经LLM评判并经人类专家评分验证的指标,我们发现Vanilla设置在超出截止日期时性能严重下降。两种检索增强方法在所有问题类型上均显著提升性能,而Web搜索带来不稳定的收益,并在历史锚定任务中表现出明显的近期偏见。我们的结果表明,可靠的法律问答需要将时序有效性视为硬性约束。
引用
@article{arxiv.2605.23497,
title = {Asking For An Old Friend: Diagnosing and Mitigating Temporal Failure Modes in LLM-based Statutory Question Answering},
author = {Max Prior and Andreas Schultz and Matthias Grabmair},
journal= {arXiv preprint arXiv:2605.23497},
year = {2026}
}