大语言模型是否理解对话性暗示——基于中国喜剧的案例研究
计算与语言
2024-08-01 v2
摘要
理解话语的非字面意义是大语言模型(LLM)成为类人社交交流者的关键。本文引入SwordsmanImp,即首个以中文多轮对话为基础的对话性暗示数据集,源自中国喜剧《我自己的剑侠》中的对话。该数据集包含200个精心构建的题目,全部标注了违反哪些格赖斯原则。我们测试了八个闭源和开源LLM,分别在多选题任务和暗示解释任务下。结果表明,GPT-4在多选题上达到人类水平准确率(94%),CausalLM准确率为78.5%。其他模型包括GPT-3.5和多个开源模型在多选题上的准确率范围为20%至60%。人类评审者被要求评估LLM生成的暗示解释的合理性、逻辑性和流畅性。虽然所有模型都生成大量流畅且自洽的文本,但除GPT-4外,其他模型的解释得分较低,表明大多数LLM无法产生对话中暗示的满意解释。此外,我们发现LLM的性能在不同格赖斯原则下差异不大,表明LLM似乎没有以不同方式处理来自不同原则的暗示。我们的数据和代码均可在https://github.com/sjtu-compling/llm-pragmatics 获取。
引用
@article{arxiv.2404.19509,
title = {Do Large Language Models Understand Conversational Implicature -- A case study with a chinese sitcom},
author = {Shisen Yue and Siyuan Song and Xinyuan Cheng and Hai Hu},
journal= {arXiv preprint arXiv:2404.19509},
year = {2024}
}
备注
14 pages, 8 tables and 5 figures