中文

评估大语言模型对韩语间接言语行为的理解能力

计算与语言 2025-02-18 v1

摘要

准确理解话语意图对于对话交流至关重要。随着对话人工智能模型在各领域的快速开发与应用,评估大语言模型(LLM)理解用户话语意图的能力变得尤为重要。本研究评估了当前大语言模型是否能够在给定对话语境下理解话语意图,特别是在实际意图与句子表面字面意图不同的情况下,即间接言语行为。我们的研究结果表明,Claude3-Opus的表现优于其他竞争模型,在多项选择题(MCQ)中达到71.94%,在开放式问答(OEQ)中达到65%,展现出明显优势。总体而言,专有模型相较于开源模型表现出相对较高的性能。然而,没有任何大语言模型达到人类水平。除Claude3-Opus外,大多数大语言模型在理解间接言语行为方面的表现显著低于直接言语行为——后者通过话语明确揭示了意图。本研究不仅通过分析OEQ回答模式对每个大语言模型的语言使用进行了全面的语用评估,还强调了进一步研究的必要性,以提升大语言模型对间接言语行为的理解能力,从而实现与人类更自然的交流。

关键词

引用

@article{arxiv.2502.10995,
  title  = {Evaluating Large language models on Understanding Korean indirect Speech acts},
  author = {Youngeun Koo and Jiwoo Lee and Dojun Park and Seohyun Park and Sungeun Lee},
  journal= {arXiv preprint arXiv:2502.10995},
  year   = {2025}
}

备注

under review (15 pages)