中文

评估LLM生成与人类撰写角色扮演对话中的响应

计算与语言 2025-10-10 v2 人工智能

摘要

在长篇、知识驱动的角色扮演对话中,对大型语言模型(LLM)的评估仍具有挑战性。本研究通过人类评估(N=38N=38)和自动LLM作为评判官的评估,比较了LLM生成和人类撰写的响应在多轮专业培训模拟中的表现。人类评估显示,LLM生成的响应质量在各轮中显著下降,尤其是在自然性、上下文维护和整体质量方面,而人类撰写的响应则逐步改善。与此同时,参与者还表明,他们持续偏好人类撰写的对话。这些人类判断经由我们自动的LLM作为评判官的评估得到验证,其中Gemini 2.0 Flash在零样本成对偏好和随机6-shot construct 评分方面均与人类评估者实现了强大的一致性,确认了LLM与人类响应之间质量差距随时间的加深。我们的工作提供了一个暴露LLM在知识驱动角色扮演对话中性能下降的多轮基准,并提供了一个经过验证的混合评估框架,以指导LLM在培训模拟中可靠的集成。

关键词

引用

@article{arxiv.2509.17694,
  title  = {Evaluating LLM-Generated Versus Human-Authored Responses in Role-Play Dialogues},
  author = {Dongxu Lu and Johan Jeuring and Albert Gatt},
  journal= {arXiv preprint arXiv:2509.17694},
  year   = {2025}
}

备注

Accepted for publication at the 18th International Natural Language Generation Conference (INLG 2025). Revised version: improved image quality and minor corrections. No change to conclusions