GovRelBench:政府领域相关性基准
人工智能
2025-07-30 v1
摘要
当前对大语言模型(LLM)在政府领域中的评估主要聚焦于特定场景下的安全性考量,而对模型自身核心能力——特别是领域相关性——的评估仍显不足。为弥补这一空白,我们提出 GovRelBench,一个专为评估 LLM 在政府领域中核心能力而设计的基准。GovRelBench 由政府领域提示与专用评估工具 GovRelBERT 组成。在 GovRelBERT 的训练过程中,我们引入了 SoftGovScore 方法:该方法通过将硬标签转换为软分数,基于 ModernBERT 架构训练模型,从而能够精确计算文本的政府领域相关性得分。本工作旨在完善大模型在政府领域的能力评估框架,为相关研究与实践提供有效工具。代码与数据集见 https://github.com/pan-xi/GovRelBench。
引用
@article{arxiv.2507.21419,
title = {GovRelBench:A Benchmark for Government Domain Relevance},
author = {Haiquan Wang and Yi Chen and Shang Zeng and Yun Bian and Zhe Cui},
journal= {arXiv preprint arXiv:2507.21419},
year = {2025}
}