中文

用于半监督任务型对话系统的变分潜态 GPT

计算与语言 2023-01-30 v3

摘要

最近,微调大型预训练语言模型和变分训练这两种方法分别引起了广泛关注,用于半监督端到端任务型对话(TOD)系统。在本文中,我们提出了变分潜态 GPT 模型(VLS-GPT),这是首个结合两种方法优势的模型。在模型的多种选择中,我们为端到端 TOD 系统的变分学习提出了生成模型和推断模型,两者均作为基于 GPT-2 的自回归语言模型,可以以半监督方式在标记和未标记对话数据的混合上进一步训练。VLS-GPT 的变分训练在统计和计算上比之前使用轮次级一阶马尔可夫性的序列潜变量模型的变分学习工作更具挑战性。由于使用了 Transformer 架构,VLS-GPT 中的推断模型是非马尔可夫的。在本工作中,我们建立了带有非马尔可夫推断模型的变分目标的递归 Monte Carlo 近似(RMCA),并证明了其无偏性。此外,我们开发了“采样后前向计算”的计算策略来实现 RMCA,成功克服了在变分学习中使用 GPT 的内存爆炸问题并加速了训练。在两种不同语言的基准多领域数据集 MultiWOZ2.1 和 CrossWOZ 上进行了半监督 TOD 实验。结果表明,VLS-GPT 显著优于仅监督和半监督自训练基线。

关键词

引用

@article{arxiv.2109.04314,
  title  = {Variational Latent-State GPT for Semi-Supervised Task-Oriented Dialog Systems},
  author = {Hong Liu and Yucheng Cai and Zhenru Lin and Zhijian Ou and Yi Huang and Junlan Feng},
  journal= {arXiv preprint arXiv:2109.04314},
  year   = {2023}
}

备注

Accepted into IEEE/ACM Transactions on Audio, Speech and Language Processing