中文

MPCEval:用于多方对话生成的基准

计算与语言 2026-03-06 v1 人工智能

摘要

多方对话生成,如智能回复和协作助手,正成为生成式 AI 的重要能力,但其评估仍是关键瓶颈。与两方对话相比,多方场景引入了独特挑战,包括复杂的轮次处理、角色相关的说话者行为、长范围对话结构以及多个等价的后续选项。因此,我们引入 MPCEval,这是一个针对多方对话生成的任务导向评估与基准套件。MPCEval 将生成质量分解为说话者建模、内容质量和说话者-内容一致性三个维度,明确区分了局部单轮预测与全局全对话生成。它提供了新颖的、无参考的、可复制的量化指标,能够跨数据集和模型进行扩展。我们将 MPCEval 应用于多样化的公开数据集和真实世界数据集,对现代生成方法进行评估,并与人工编写的对话进行比较。结果揭示了在参与者平衡、内容进展与新颖性以及说话者-内容一致性等方面存在系统性、维度特定的模型特征,表明评估目标对模型评估至关重要,单一评分评估掩盖了多方对话行为中根本性差异。MPCEval 及其相关评估代码已公开发布于 https://github.com/Owen-Yang-18/MPCEval。

关键词

引用

@article{arxiv.2603.04969,
  title  = {MPCEval: A Benchmark for Multi-Party Conversation Generation},
  author = {Minxing Zhang and Yi Yang and Zhuofan Jia and Xuan Yang and Jian Pei and Yuchen Zang and Xingwang Deng and Xianglong Chen},
  journal= {arXiv preprint arXiv:2603.04969},
  year   = {2026}
}