ArcMMLU:面向大语言模型的图书情报学基准
计算与语言
2023-12-01 v1
摘要
鉴于大语言模型(LLMs)能力的快速演进,亟需开发严谨的领域专用评测基准以准确评估其能力。为满足此需求,本文引入ArcMMLU,一个面向中文图书情报学(LIS)领域的专用基准。该基准旨在衡量LLMs在档案学、数据科学、图书馆学与信息科学四个关键子域中的知识与推理能力。遵循MMLU/CMMLU格式,我们收集了逾6000道高质量题目以编纂ArcMMLU。该大规模编纂可反映LIS领域的多样性,并为LLM评测提供坚实基础。我们的综合评测显示,尽管多数主流LLM在ArcMMLU上平均准确率超50%,仍存在显著性能差距,表明LIS领域内LLM能力尚有较大改进空间。进一步分析探讨了少样本示例对模型性能的有效性,并指出了模型持续表现不佳的难题,为针对性改进提供宝贵洞见。ArcMMLU填补了中文LIS领域LLM评测的关键空白,并为面向该专用领域未来LLM的发展铺平道路。
引用
@article{arxiv.2311.18658,
title = {ArcMMLU: A Library and Information Science Benchmark for Large Language Models},
author = {Shitou Zhang and Zuchao Li and Xingshen Liu and Liming Yang and Ping Wang},
journal= {arXiv preprint arXiv:2311.18658},
year = {2023}
}