中文

大语言模型韩语语用能力评估

计算与语言 2024-10-18 v2

摘要

基准测试在当前的大语言模型(LLM)评估中发挥着重要作用,但它们往往忽视模型捕捉人类语言细微差异的能力,主要侧重于评估嵌入的知识与技术能力。为弥补这一不足,本研究评估了 LLM 在语用学视角下理解上下文相关表达的能力,具体针对韩语。我们同时采用用于自动评估的多项选择题(MCQ)与由人类专家评判的开放式问题(OEQ)。结果显示,GPT-4 以 MCQ 81.11 分与 OEQ 85.69 分领先,HyperCLOVA X 紧随其后。此外,虽然少样本学习通常能提升性能,但思维链(CoT)提示倾向于鼓励字面化解读,这可能限制有效的语用推理。我们的研究结果凸显了让 LLM 更好地理解并生成反映人类交际规范的语言的必要性。

关键词

引用

@article{arxiv.2403.12675,
  title  = {Pragmatic Competence Evaluation of Large Language Models for the Korean Language},
  author = {Dojun Park and Jiwoo Lee and Hyeyun Jeong and Seohyun Park and Sungeun Lee},
  journal= {arXiv preprint arXiv:2403.12675},
  year   = {2024}
}

备注

38th Pacific Asia Conference on Language, Information and Computation