面向垂直领域评估的中文 LLM 专业资格本土化基准——QualBench
机器学习
2025-05-09 v1
摘要
中文大语言模型的快速发展凸显了确保可靠应用的垂直领域评估需求。然而,现有基准常缺乏领域覆盖,提供有限的中文工作背景洞察。我们以资格考试作为统一的专业能力评估框架,引入QualBench——首个专注于中文 LLM 本土化专业资格评估的多领域中文 QA 基准数据集。数据集包含来自24个中文资格考试的6个垂直领域的超过17,000个问题,用以契合国家政策和职业标准。结果显示,中文 LLM 在准确率上持续超越非中文模型,其中Qwen2.5模型优于更先进的GPT-4o,凸显了本土化领域知识在满足资格要求方面的价值。平均准确率为53.98%,揭示了模型能力在领域覆盖方面的当前不足。此外,我们识别了 LLM 众包导致的性能下降,评估了数据污染情况,并展示了提示工程和模型微调的有效性,表明通过多领域RAG和联邦学习可为未来改进提供机遇。
引用
@article{arxiv.2505.05224,
title = {GFlowNets for Active Learning Based Resource Allocation in Next Generation Wireless Networks},
author = {Charbel Bou Chaaya and Mehdi Bennis},
journal= {arXiv preprint arXiv:2505.05224},
year = {2025}
}