PlatoLM:通过用户模拟器在多轮对话中教导大语言模型
计算与语言
2024-08-27 v6 人工智能
摘要
闭源的 ChatGPT 无与伦比的性能引发了其民主化的努力,利用真实用户与 ChatGPT 对话取得显著进展,Vicuna 即为明证。然而,由于收集涉及人类参与的对话面临挑战,当前如 Baize 和 UltraChat 等工作依赖 ChatGPT 基于指令进行角色扮演以模拟人类,导致对种子数据的过度依赖、类人性下降、话题多样性有限以及缺乏真实的多轮对话动态。为解决上述问题,我们提出一种范式以更好地模拟人类行为,并探索在多轮对话中引入更具类人性问题的益处。具体而言,我们直接以从真实人机对话中提取的人类问题为学习目标,并提供一种名为“Socratic”的新型用户模拟器。实验结果表明,我们的回复模型“PlatoLM”在 MT-Bench 上于基于 LLaMA 的 7B 模型中取得了 SOTA 性能。我们的发现进一步表明,该方法引入了高度类人的提问模式和丰富的主题结构,相较于以往工作在多轮对话中能更好地教导回复模型。
引用
@article{arxiv.2308.11534,
title = {PlatoLM: Teaching LLMs in Multi-Round Dialogue via a User Simulator},
author = {Chuyi Kong and Yaxin Fan and Xiang Wan and Feng Jiang and Benyou Wang},
journal= {arXiv preprint arXiv:2308.11534},
year = {2024}
}
备注
23 pages