中文

LLM中文常识推理基准测试:从中文特有知识到推理-记忆相关性

计算与语言 2024-12-11 v3

摘要

我们引入了CHARM,这是第一个全面深入评估大型语言模型(LLM)中文常识推理能力的基准,涵盖了全球通用和中文特有的常识。我们在CHARM上评估了7个英文和12个中文导向的LLM,采用了5种代表性的提示策略(如思维链)来提升LLM的推理能力。我们的发现表明,LLM的语言倾向和任务的领域会影响提示策略的有效性,这丰富了先前的研究结果。我们构建了紧密关联的推理和记忆任务,并发现一些LLM在记忆中文常识方面存在困难,影响了其推理能力,而另一些LLM尽管记忆表现相似,但在推理上存在差异。我们还评估了LLM的独立于记忆的推理能力,并分析了典型错误。我们的研究精确识别了LLM的优势和弱点,为优化提供了明确方向。它也可以作为其他领域研究的参考。我们将在https://github.com/opendatalab/CHARM发布CHARM。

关键词

引用

@article{arxiv.2403.14112,
  title  = {Benchmarking Chinese Commonsense Reasoning of LLMs: From Chinese-Specifics to Reasoning-Memorization Correlations},
  author = {Jiaxing Sun and Weiquan Huang and Jiang Wu and Chenya Gu and Wei Li and Songyang Zhang and Hang Yan and Conghui He},
  journal= {arXiv preprint arXiv:2403.14112},
  year   = {2024}
}

备注

Equal contribution: Jiaxing Sun, Weiquan Huang, Jiang Wu; Corresponding author: Conghui He