评估LLM生成与人类撰写角色扮演对话中的响应
计算与语言
2025-10-10 v2 人工智能
摘要
在长篇、知识驱动的角色扮演对话中,对大型语言模型(LLM)的评估仍具有挑战性。本研究通过人类评估()和自动LLM作为评判官的评估,比较了LLM生成和人类撰写的响应在多轮专业培训模拟中的表现。人类评估显示,LLM生成的响应质量在各轮中显著下降,尤其是在自然性、上下文维护和整体质量方面,而人类撰写的响应则逐步改善。与此同时,参与者还表明,他们持续偏好人类撰写的对话。这些人类判断经由我们自动的LLM作为评判官的评估得到验证,其中Gemini 2.0 Flash在零样本成对偏好和随机6-shot construct 评分方面均与人类评估者实现了强大的一致性,确认了LLM与人类响应之间质量差距随时间的加深。我们的工作提供了一个暴露LLM在知识驱动角色扮演对话中性能下降的多轮基准,并提供了一个经过验证的混合评估框架,以指导LLM在培训模拟中可靠的集成。
引用
@article{arxiv.2509.17694,
title = {Evaluating LLM-Generated Versus Human-Authored Responses in Role-Play Dialogues},
author = {Dongxu Lu and Johan Jeuring and Albert Gatt},
journal= {arXiv preprint arXiv:2509.17694},
year = {2025}
}
备注
Accepted for publication at the 18th International Natural Language Generation Conference (INLG 2025). Revised version: improved image quality and minor corrections. No change to conclusions