中文

通过提示优化利用 LLM 作为裁判在自由文本法律问答中的倾向性

计算与语言 2026-04-24 v2 人工智能

摘要

这项工作探讨了提示设计和裁判选择在 LLM 作为裁判评估自由文本法律问答中的作用。我们研究了自动任务提示优化是否优于以人为中心的设计,优化效果是否因裁判反馈风格而异,以及优化后的提示是否能在不同裁判之间迁移。我们通过在 LEXam 基准上系统地解决这些问题,使用 ProTeGi 方法优化任务提示,并利用来自两个裁判(Qwen3-32B, DeepSeek-V3)的反馈,在四个任务模型上进行优化,然后测试跨裁判迁移。自动优化始终优于基线,宽松的裁判反馈比严格的裁判反馈带来更高且更一致的增益。使用宽松反馈优化的提示比反向方向更好地迁移到严格的裁判。分析表明,宽松的裁判提供宽容的反馈,产生具有更广泛适用性的提示,而严格的裁判产生限制性的反馈,导致特定于裁判的过拟合。我们的发现表明,在训练数据上算法优化提示可以超越以人为中心的提示设计,并且裁判在优化过程中的倾向性塑造了提示的泛化能力。

关键词

引用

@article{arxiv.2604.20726,
  title  = {Exploiting LLM-as-a-Judge Disposition on Free Text Legal QA via Prompt Optimization},
  author = {Mohamed Hesham Elganayni and Runsheng Chen and Sebastian Nagl and Matthias Grabmair},
  journal= {arXiv preprint arXiv:2604.20726},
  year   = {2026}
}

备注

Accepted at the 21st International Conference on Artificial Intelligence and Law (ICAIL 2026), Singapore, June 8-12, 2026. 10 pages, 14 figures, 2 tables