中文

DialogueForge:LLM 模拟人类-聊天机器人对话

计算与语言 2025-07-22 v1 人工智能

摘要

收集人类-聊天机器人对话通常需要大量的手动工作且耗时,这限制和构成了 conversational AI 研究的挑战。本文提出了 DialogueForge - 一个用于生成以人类-聊天机器人风格进行的 AI 模拟对话的框架。为初始化每个生成的对话,DialogueForge 使用从真实人类-聊天机器人互动中提取的种子提示。我们测试了各种 LLM 来模拟人类聊天机器人用户,从最先进的专有模型到小规模开源 LLM,并生成针对特定任务的多轮对话。此外,我们探索了微调技术以增强较小模型产生难以区分的人类式对话的能力。我们评估了模拟对话的质量并使用 UniEval 和 GTEval 评估协议比较不同模型。我们的实验表明,大型专有模型(如 GPT-4o)在生成更真实的对话方面总体上优于其他模型,而较小的开源模型(如 Llama、Mistral)在更大的定制化方面提供了有前景的性能。我们演示了通过采用监督式微调技术可以显著提高较小模型的性能。然而,维持连贯和自然的长篇人类式对话仍是所有模型普遍面临的挑战。

关键词

引用

@article{arxiv.2507.15752,
  title  = {DialogueForge: LLM Simulation of Human-Chatbot Dialogue},
  author = {Ruizhe Zhu and Hao Zhu and Yaxuan Li and Syang Zhou and Shijing Cai and Malgorzata Lazuka and Elliott Ash},
  journal= {arXiv preprint arXiv:2507.15752},
  year   = {2025}
}

备注

For our code and data, see https://github.com/nerchio/Human_Chatbot-Generation