中文

面向少样本对话生成的双阶段自增强自训练方法

计算与语言 2022-10-13 v2

摘要

在任务型对话系统中,从语义表示(MRs)生成回复常受限于训练样本不足,原因在于标注 MR-to-Text(语义表示到文本)对的成本高昂。已有的自训练工作利用微调后的对话模型自动生成伪标注的 MR-to-Text 对以进一步微调。然而,部分自增强数据可能对模型学习而言存在噪声或缺乏信息量。本工作中,我们提出一种双阶段自增强流程以生成高质量伪标注 MR-to-Text 对:第一阶段基于模型预测不确定性筛选最具信息量的 MRs;利用所选 MRs,第二阶段通过聚合每个 MR 的多个扰动隐表示来生成准确回复。在两个基准数据集 FewShotWOZ 与 FewShotSGD 上的实证实验表明,我们的方法在自动与人工评估上总体优于现有自训练方法。

关键词

引用

@article{arxiv.2205.09661,
  title  = {Self-training with Two-phase Self-augmentation for Few-shot Dialogue Generation},
  author = {Wanyu Du and Hanjie Chen and Yangfeng Ji},
  journal= {arXiv preprint arXiv:2205.09661},
  year   = {2022}
}

备注

Findings of EMNLP2022