享受你的对话:一个以人为中心的多轮对话基准,具有解耦的用户模拟、目标建模和评判
计算与语言
2026-07-11 v1
摘要
评估大型语言模型(LLM)作为多轮对话伙伴,需要探测单轮基准测试所缺失的能力:人物一致性、不断演变的意图跟踪、情感动态和目标完成。我们引入了 EYT-Bench,一个以人为中心的基准测试,围绕三方解耦设计构建:一个基于人物角色的用户模拟器,一个将意图感知与响应生成分离的目标模型,以及一个独立的第三方 LLM 评判器,可选择多评判器集成。人物角色是从公开的、人工策划的语料库 Nemotron-Personas-USA 和 PersonaMem-v2 中采样,而非合成,从而减少了 LLM 引发的人物偏见。EYT-Bench 还引入了两个轨迹级指标:基于嵌入的意图漂移和最终意图完成率(FICR),其灵感来自 tau-bench。在 17 个目标 x 200 个对话的评估中,EYT-Bench 揭示了四个发现:(i)最先进的闭源和开源模型在主观维度(同理心/人物/拟人化在 <= 0.3 范围内变化)上统计上接近,但在客观意图跟踪上差异高达 9 倍;(ii)推理(“思考”)显著改善了长上下文人物角色上的客观跟踪(Gemma-4 上的潜在意图准确率 +0.47-0.50),而主观分数几乎不变;(iii)人物角色格式主导了轨迹分布,FICR 在 Nemotron-USA 上饱和于 0.95 以上,但在 PersonaMem-v2 上从 0.53 分布到 0.88;(iv)预热效应在 16/17 个模型上是稳健的(一个异常值 GPT-5.5 逆转了该效应),在 alpha 在 [0.05, 0.15] 范围内排名稳定。使用 deepseek-v4-pro 进行的跨评判器消融实验证实,目标排名和最终意图满意度在不同评判器间得以保留。
引用
@article{arxiv.2607.10428,
title = {Enjoy Your Talk: A Human-Centered Benchmark for Multi-Turn Dialogue with Decoupled User Simulation, Target Modeling, and Judging},
author = {Jinglan Gong and Jiefan Lu and Hewei Guo and Kehan Li and Zhiyuan Han and Jihang Jiang and Wenwen Tong and Lewei Lu},
journal= {arXiv preprint arXiv:2607.10428},
year = {2026}
}