中文

BenGER 平台:面向德国法律任务的端到端基准测试协作平台

计算与语言 2026-05-28 v3 人工智能

摘要

评估大型语言模型(LLM)的法律推理能力需要涵盖任务设计、专家标注、模型运行与基于指标的评估等多个环节。实际操作中,这些步骤分散在不同平台和脚本中,限制了透明度、可复现性以及非技术法律专家的参与。我们提出 BenGER(Benchmark for German Law)框架,一个开源 Web 平台,集成任务创建、协作标注、可配置的 LLM 测试运行以及基于词法、语义、事实和判官式指标的评估。BenGER 支持多组织项目,提供租户隔离和基于角色的访问控制,可选提供面向标注者的形式化、参考依据驱动的反馈。我们将展示一次现场部署,演示端到端基准创建与分析。

关键词

引用

@article{arxiv.2604.13583,
  title  = {BenGER Platform: A Collaborative Web Platform for End-to-End Benchmarking of German Legal Tasks},
  author = {Sebastian Nagl and Matthias Grabmair},
  journal= {arXiv preprint arXiv:2604.13583},
  year   = {2026}
}

备注

Preprint - Accepted at ICAIL 2026