从原始语料库到领域基准:自动化评估大语言模型的领域专业性
计算与语言
2026-03-09 v3
摘要
准确的领域特定基准测试对于评估大语言模型至关重要,尤其是在对人类有直接影响的领域,如法律、医疗和教育。然而,现有的基准测试被证明存在数据污染,且基于多选题,这类问题受内在偏见的影响。为衡量大语言模型的领域特定知识,我们提出了一条确定性管道,将原始领域语料库转化为无需依赖其他大语言模型或高成本人工标注的完成式基准测试。我们的ethods方法首先从输入语料库中提取领域特定关键词及相关目标词汇,然后构建提示-目标对,其中领域特定词汇作为预测目标。通过衡量大语言模型完成这些提示的能力,我们以较低的计算成本提供了领域知识的直接评估。我们的管道避免了基准测试的污染,支持使用新的领域数据进行自动更新,并促进了基础模型与指令微调(聊天)模型之间的公平比较。我们通过表明模型在我们基准测试上的表现与专家精选基准测试的表现显著相关来验证了我们的ethods方法。随后,我们展示了我们的基准测试如何提供有关领域自适应、持续和通用预训练中知识获取的见解。最后,我们在统一的评估框架内比较基础模型和聊天模型,以检验指令微调的效果。总之,我们的管道实现了可扩展的、领域特定的、独立于大语言模型的以及无偏见的基础模型和聊天模型评估。
引用
@article{arxiv.2506.07658,
title = {From Raw Corpora to Domain Benchmarks: Automated Evaluation of LLM Domain Expertise},
author = {Nitin Sharma and Thomas Wolfers and Çağatay Yıldız},
journal= {arXiv preprint arXiv:2506.07658},
year = {2026}
}
备注
36 pages, 24 figures. Third version