GreekBarBench:自由文本法律推理与引用的挑战性基准
计算与语言
2025-12-24 v3 人工智能
摘要
我们介绍GreekBarBench,一个评估LLM在希腊律师考试中涵盖五个不同法律领域的法律问题的基准,要求引用成文法条文和案例事实。为解决自由文本评估的挑战,我们提出了三维评分系统结合LLM作为评判员的方法。我们还开发了一个元评估基准来评估LLM评判员与人类专家评估之间的相关性,结果显示简单以区间为基础的评分标准能提高其对齐度。我们系统评估了13个专有和开源LLM,结果表明尽管最佳模型超越了平均专家得分,但不足以达到专家的第95百分位。
引用
@article{arxiv.2505.17266,
title = {Select2Reason: Efficient Instruction-Tuning Data Selection for Long-CoT Reasoning},
author = {Cehao Yang and Xueyuan Lin and Xiaojun Wu and Chengjin Xu and Xuhui Jiang and Honghao Liu and Hui Xiong and Jian Guo},
journal= {arXiv preprint arXiv:2505.17266},
year = {2025}
}