中文

DialoGPS:连续语义空间中的对话路径采样用于多轮对话数据增强

计算与语言 2023-06-30 v1 人工智能

摘要

在开放域对话生成任务中,多数数据集的上下文与回复为一对一映射,违背了一个重要特性——多对多:一个上下文引出多种回复,而一个回复可应答多个上下文。缺乏此类模式会导致模型泛化能力差且偏好安全回复。已有诸多尝试从一对多视角处理多轮设定,或从多对多视角但限于单轮设定。多对多增强多轮对话的主要挑战在于,以语义相似离散替换每一轮会破坏脆弱的上下文连贯性。本文提出连续语义空间中的对话路径采样(DialoGPS)方法,这是首个面向多轮对话的多对多增强方法。具体而言,我们将对话映射到扩展布朗桥——一种特殊高斯过程。我们采样潜变量以在连续空间中形成连贯对话路径。一条对话路径对应一个新的多轮对话,并用作增强训练数据。我们通过自动与人工评估展示了 DialoGPS 的效果。

关键词

引用

@article{arxiv.2306.16770,
  title  = {DialoGPS: Dialogue Path Sampling in Continuous Semantic Space for Data Augmentation in Multi-Turn Conversations},
  author = {Ang Lv and Jinpeng Li and Yuhan Chen and Xing Gao and Ji Zhang and Rui Yan},
  journal= {arXiv preprint arXiv:2306.16770},
  year   = {2023}
}

备注

ACL 2023 main