中文

DocTalk:用于增强大语言模型对话能力的可扩展基于图的数据对话合成

计算与语言 2025-07-09 v1

摘要

大语言模型 (LLM) 越来越多地用于多轮对话任务, 但其预训练数据主要由连续的 prose 组成, 这种情况在所需能力与训练范式之间存在潜在的不匹配。我们提出一种新方法来解决这一差异, 通过从现有文本语料库合成对话数据。我们呈现了一个将多个相关文档集群转换为扩展的多轮、多主题信息寻求对话的管道。将我们的管道应用于 Wikipedia 文章后, 我们构建了 DocTalk, 一个包含超过 73 万轮长对话的多轮预训练对话语料库。我们假设在预训练期间对此类合成对话结构的暴露可以增强 LLM 的基本多轮能力, 如上下文记忆和理解。经验上,我们表明在预训练时纳入 DocTalk 可在不牺牲基础性能的前提下, 实现上下文记忆和理解能力最高可提升 40%。DocTalk 可在 https://huggingface.co/datasets/AmazonScience/DocTalk 上获得。

关键词

引用

@article{arxiv.2507.05750,
  title  = {DocTalk: Scalable Graph-based Dialogue Synthesis for Enhancing LLM Conversational Capabilities},
  author = {Jing Yang Lee and Hamed Bonab and Nasser Zalmout and Ming Zeng and Sanket Lokegaonkar and Colin Lockard and Binxuan Huang and Ritesh Sarkhel and Haodong Wang},
  journal= {arXiv preprint arXiv:2507.05750},
  year   = {2025}
}

备注

Accepted at SIGDIAL 2025