DiverseDialogue:一种设计具有类人多样性的聊天机器人的方法
计算与语言
2024-09-04 v1
摘要
大型语言模型 (LLMs) 常被用来模拟人类用户,以评估辅导和客服等应用中的聊天机器人。有效的评估需要这些模拟具有高度的类人多样性。在本文中,我们证明,当 GPT-4o mini 生成的对话被用作模拟人类参与者时,其在多个语言特征上系统地不同于真实人类之间的对话。这些特征包括主题变化、词汇属性,以及所用语言的平均行为和多样性(方差)。为了解决这些差异,我们提出了一种方法,通过融入从真实人类交互中提取的特征(如年龄、性别、情绪基调以及讨论的主题)来自动生成用户模拟的提示。我们使用差异语言分析结合深层语言探究来评估我们的方法。我们针对特定语言特征定制的提示优化方法显示出显著的改进。具体来说,它增强了 LLM 聊天机器人对话的类人性,增加了其语言多样性。平均而言,我们观察到人类对话与 LLM 生成对话之间平均特征误差减少了 54%。这种构建具有类人多样性的聊天机器人集合的方法,在增强面向用户的机器人的评估过程方面具有巨大潜力。
引用
@article{arxiv.2409.00262,
title = {DiverseDialogue: A Methodology for Designing Chatbots with Human-Like Diversity},
author = {Xiaoyu Lin and Xinkai Yu and Ankit Aich and Salvatore Giorgi and Lyle Ungar},
journal= {arXiv preprint arXiv:2409.00262},
year = {2024}
}