大语言模型能否精准复刻我们?基于ECHO评估AI聊天机器人的角色扮演能力
计算与语言
2024-04-23 v1
摘要
大型语言模型(LLM)的角色扮演能力已成为热门研究方向。然而,现有研究聚焦于模仿知名公众人物或虚构角色,忽略了模拟普通个体的潜力。这一局限限制了数字人类克隆和视频游戏中非玩家角色(NPC)的潜力发展。为弥合这一差距,我们引入ECHO——一个受图灵测试启发的评估框架。该框架邀请目标个体的熟人以区分人类和机器生成的回应为任务。值得注意的是,我们的框架专注于模拟普通人,而非历史人物或虚构角色,这为应用图灵测试提供了独特优势。我们使用ECHO评估了三个角色扮演LLM,GPT-3.5和GPT-4作为基础模型,另外还有来自OpenAI的在线应用GPTs。我们的结果表明,GPT-4更有效地欺骗人类评估者,GPTs实现了最高的成功率为48.3%。此外,我们调查了LLM是否能够区分人类生成和机器生成的文本。尽管GPT-4能够识别差异,但无法确定哪些文本是人类产生的。我们的代码和角色扮演LLM的复现结果已通过https://github.com/CUHK-ARISE/ECHO公开。
引用
@article{arxiv.2404.13957,
title = {How Well Can LLMs Echo Us? Evaluating AI Chatbots' Role-Play Ability with ECHO},
author = {Man Tik Ng and Hui Tung Tse and Jen-tse Huang and Jingjing Li and Wenxuan Wang and Michael R. Lyu},
journal= {arXiv preprint arXiv:2404.13957},
year = {2024}
}
备注
9 pages