衡量大规模多任务中文理解能力
计算与语言
2026-05-28 v3 人工智能
摘要
大规模中文语言模型的发展方兴未艾,然而缺乏相应的能力评估。因此,我们提出一项测试以衡量大型中文语言模型的多任务准确率。该测试涵盖医学、法律、心理学和教育四大领域,其中医学含 15 个子任务,教育含 8 个子任务。我们发现,零样本设定下表现最佳的模型平均优于表现最差模型近 18.6 个百分点。在四大领域中,所有模型的零样本平均最高准确率为 0.512。在子领域中,仅 GPT-3.5-turbo 模型在临床医学中达到 0.693 的零样本准确率,为所有模型在所有子任务中的最高值。所有模型在法律领域表现欠佳,零样本最高准确率仅达 0.239。通过综合评估跨学科知识的广度与深度,该测试能更准确地识别模型的不足。
引用
@article{arxiv.2304.12986,
title = {Measuring Massive Multitask Chinese Understanding},
author = {Hui Zeng},
journal= {arXiv preprint arXiv:2304.12986},
year = {2026}
}