中文

MultiPragEval:大型语言模型的多语言语用评估

计算与语言 2024-10-01 v3

摘要

随着大型语言模型(LLM)能力的不断提升,仅进行基础知识评估已不足以全面评估其性能,必须关注更高层次的语言理解能力。本研究引入MultiPragEval,即首个针对大型语言模型的多语言语用评估,支持英语、德语、韩语和中文。MultiPragEval包含1200个问答单元,依据格赖斯合作原则及其四个对话最大化原则进行分类,使我们能够深入评估LLM的情境感知能力及其推断隐含意义的能力。我们的发现表明,Claude3-Opus在所有测试语言中均显著优于其他模型,树立了该领域的先进水平。在开源模型中,Solar-10.7B和Qwen1.5-14B表现出色。通过分析语用推理,我们为理解人工智能系统中必需的高级语言理解能力提供了宝贵见解。

关键词

引用

@article{arxiv.2406.07736,
  title  = {MultiPragEval: Multilingual Pragmatic Evaluation of Large Language Models},
  author = {Dojun Park and Jiwoo Lee and Seohyun Park and Hyeyun Jeong and Youngeun Koo and Soonha Hwang and Seonwoo Park and Sungeun Lee},
  journal= {arXiv preprint arXiv:2406.07736},
  year   = {2024}
}

备注

The 2nd GenBench workshop on generalisation (benchmarking) in NLP