PolicyLLM:面向大型语言模型的公共政策理解能力提升
计算与语言
2026-04-15 v1 计算机与社会
摘要
大型语言模型(LLM)正逐渐被集成到实际决策场景中,包括公共政策领域。然而,其理解与推理政策相关内容的能力仍未得到充分探索。为填补这一空白,我们提出了\textbf{\textit{PolicyBench}}——首个规模庞大的跨系统基准测试体系(覆盖美中两国),涵盖2.1万个案例,涉及广泛的政策领域,捕捉真实治理的多样性与复杂性。依据布卢姆分类法,基准测试评估三项核心能力:(1)\textbf{记忆}——政策知识的事实性回忆;(2)\textbf{理解}——概念层面的推理与情境分析;(3)\textbf{应用}——真实情境下的问题解决。基于此基准,我们进一步提出了\textbf{\textit{PolicyMoE}}——一种面向政策领域的混合专家(Mixture-of-Experts, MoE)模型,包含针对不同认知层级的专家模块。所提模型在以应用为导向的政策任务上表现优于记忆或概念理解任务,在结构化推理任务上取得最高准确率。我们的研究结果揭示了当前LLM在政策理解方面的关键局限,并指出提升其可靠性的可能路径。
引用
@article{arxiv.2604.12995,
title = {PolicyLLM: Towards Excellent Comprehension of Public Policy for Large Language Models},
author = {Han Bao and Penghao Zhang and Yue Huang and Zhengqing Yuan and Yanchi Ru and Rui Su and Yujun Zhou and Xiangqi Wang and Kehan Guo and Nitesh V Chawla and Yanfang Ye and Xiangliang Zhang},
journal= {arXiv preprint arXiv:2604.12995},
year = {2026}
}
备注
Accepted by ACL 2026 findings