中文

POLIS-Bench:面向政府场景下双语政策任务 LLM 多维度评估

计算与语言 2025-11-10 v1 人工智能

摘要

我们介绍 POLIS-Bench,首个为 LLM 在政府双语政策场景中提供严谨、系统评估套件。与现有基准测试相比,POLIS-Bench 具有三大突破性进展。(i)最新双语语料库:我们构建了广泛、最新的政策语料库,显著扩大了有效评估样本规模,确保与当前治理实践相关。(ii)场景嵌入任务设计:我们提炼出三个专业、场景嵌入任务——条款检索与解释、方案生成和合规判断——全面探测模型理解和应用能力。(iii)双指标评估框架:我们建立了新型双指标评估框架,将语义相似性与准确率结合,精确衡量内容对齐与任务要求遵循程度。对超过 10 个最先进 LLM 在 POLIS-Bench 上的大规模评估显示,推理模型在跨任务稳定性和准确性方面保持优势,凸显合规任务的难度。进一步利用本基准,我们成功微调了一个轻量级开源模型。 resulting POLIS 系列模型 在多个政策子任务上实现与甚至超越强大专有基线的性能,同时成本大幅降低,为稳健的现实政府部署提供了成本效益且合规的路径。

关键词

引用

@article{arxiv.2511.04705,
  title  = {POLIS-Bench: Towards Multi-Dimensional Evaluation of LLMs for Bilingual Policy Tasks in Governmental Scenarios},
  author = {Tingyue Yang and Junchi Yao and Yuhui Guo and Chang Liu},
  journal= {arXiv preprint arXiv:2511.04705},
  year   = {2025}
}

备注

16 pages, 6 figures