中文

LLM 是否饱受多方宿醉之苦?一种面向对话中受话者识别与回复选择的诊断方法

计算与语言 2026-03-30 v1

摘要

由于对话的语言特征与结构特征之间的相互关联,评估多方对话 (MPC) 分类系统的性能具有挑战性。传统的评估方法往往忽略了模型在交互图不同结构复杂度层级上的行为差异。在本工作中,我们提出了一种方法学流程,以研究模型在对话特定结构属性上的表现。作为概念验证,我们聚焦于回复选择和受话者识别任务,以诊断模型的弱点。为此,我们从大型开放的在线 MPC 语料库中提取了具有固定用户数量和良好结构多样性的代表性诊断子数据集。我们进一步将工作置于数据最小化的框架下,避免使用原始用户名以保护隐私,并提出了替代使用原始文本消息的方法。结果表明,回复选择更多地依赖于对话的文本内容,而受话者识别则需要捕捉其结构维度。在零样本设置下使用 LLM,我们进一步强调了对提示变化的敏感性如何依赖于具体任务。

关键词

引用

@article{arxiv.2409.18602,
  title  = {Do LLMs suffer from Multi-Party Hangover? A Diagnostic Approach to Addressee Recognition and Response Selection in Conversations},
  author = {Nicolò Penzo and Maryam Sajedinia and Bruno Lepri and Sara Tonelli and Marco Guerini},
  journal= {arXiv preprint arXiv:2409.18602},
  year   = {2026}
}

备注

Accepted to EMNLP 2024 main conference