AC-EVAL:评估大语言模型中的古汉语理解能力
计算与语言
2024-03-12 v1
摘要
鉴于古汉语在捕捉丰富历史和文化遗产精髓方面的重要性,大语言模型(LLMs)的快速发展 necessitate 能够有效评估其对古代语境理解的基准。为了满足这一需求,我们提出了 AC-EVAL,这是一个旨在评估 LLMs 在古汉语语境下的高级知识和推理能力的创新基准。AC-EVAL 构建了反映语言理解不同方面的三个难度级别:一般历史知识、短文理解和长文理解。该基准包含 13 项任务,涵盖历史事实、地理、社会习俗、艺术、哲学、古典诗词和散文,提供了一个全面的评估框架。我们对针对英语和汉语优化的顶级 LLMs 进行的广泛评估表明,在提升古文理解方面存在巨大潜力。通过突出 LLMs 的优势和劣势,AC-EVAL 旨在促进其在古汉语教育和学术研究领域的发展与应用。AC-EVAL 数据和评估代码可在 https://github.com/yuting-wei/AC-EVAL 获取。
引用
@article{arxiv.2403.06574,
title = {AC-EVAL: Evaluating Ancient Chinese Language Understanding in Large Language Models},
author = {Yuting Wei and Yuanxing Xu and Xinru Wei and Simin Yang and Yangfu Zhu and Yuqing Li and Di Liu and Bin Wu},
journal= {arXiv preprint arXiv:2403.06574},
year = {2024}
}