评估大型中文语言模型的生成能力
计算与语言
2026-05-28 v5
摘要
本文发布 CG-Eval,首个专为评估大型中文语言模型在多个学科领域生成能力而设计的综合性自动化评估框架。CG-Eval 以其自动化流程脱颖而出,基于模型在六大关键领域——科学与工程、人文社会科学、数学计算、执业医师资格考试、司法考试与注册会计师考试中,对多样化问题生成精确且语境相关回答的能力进行关键评估。与此同时,我们引入 Gscore,一种由多指标加权求和得到的创新复合指数。Gscore 独特地自动化衡量模型文本生成相对参考标准的质量,提供细致入微的模型性能评估。该自动化不仅提升了评估过程的效率与可扩展性,也确保了跨模型客观且一致的评估。突显所评估模型强劲能力与比较性能的详细测试数据与结果见 http://cgeval.besteasy.com/。
引用
@article{arxiv.2308.04823,
title = {Evaluating the Generation Capabilities of Large Chinese Language Models},
author = {Hui Zeng and Jingyuan Xue and Meng Hao and Chen Sun and Bin Ning and Na Zhang},
journal= {arXiv preprint arXiv:2308.04823},
year = {2026}
}