CitizenQuery基准:衡量大语言模型在市民查询任务中性能的新型数据集与评估管道
计算机与社会
2026-02-05 v1
摘要
市民查询是个体就与其相关情形的政府政策、指导方针和服务所提出的问题,涵盖福利、税务、移民、就业、公共卫生等多种主题。这一用例为大语言模型(LLM)提供了机会,使其能够针对用户情境和需求的响应来回应市民查询。然而,在此用例中,任何误导性信息都可能对依赖模型响应的用户产生严重、不可见的负面影响。为此,我们引入CitizenQuery-UK数据集,包含22,000对市民查询与响应的配对,这些查询与响应是从关于英国政府的公开信息中合成生成的。我们介绍CitizenQuery-UK的数据集策划方法及内容概览。我们还引入一种用于对LLMs进行基准测试的方法,采用对FActScore的改编,对11个模型进行事实性、驳回频率和 verbosity进行基准测试。我们记录了这些结果,并就公共部门情境下进行解释,发现:(i)不同模型家族存在不同的性能轮廓,但每个模型都具有竞争力;(ii)高方差削弱了实用性;(iii)驳回率低且 verbosity高,这对可靠性具有影响;(iv)更可信的AI需要在与用户交互时承认其“不可靠性”。我们的研究贡献在于评估大语言模型在市民查询任务中的可信度;随着AI日益融入日常生活,构建在完全公开数据之上的本基准为关于AI与公共部门的决策提供了更可靠的依据。
引用
@article{arxiv.2602.04064,
title = {The CitizenQuery Benchmark: A Novel Dataset and Evaluation Pipeline for Measuring LLM Performance in Citizen Query Tasks},
author = {Neil Majithia and Rajat Shinde and Zo Chapman and Prajun Trital and Jordan Decker and Manil Maskey and Elena Simperl and Nigel Shadbolt},
journal= {arXiv preprint arXiv:2602.04064},
year = {2026}
}