面向少样本对话生成的双阶段自增强自训练方法
计算与语言
2022-10-13 v2
摘要
在任务型对话系统中,从语义表示(MRs)生成回复常受限于训练样本不足,原因在于标注 MR-to-Text(语义表示到文本)对的成本高昂。已有的自训练工作利用微调后的对话模型自动生成伪标注的 MR-to-Text 对以进一步微调。然而,部分自增强数据可能对模型学习而言存在噪声或缺乏信息量。本工作中,我们提出一种双阶段自增强流程以生成高质量伪标注 MR-to-Text 对:第一阶段基于模型预测不确定性筛选最具信息量的 MRs;利用所选 MRs,第二阶段通过聚合每个 MR 的多个扰动隐表示来生成准确回复。在两个基准数据集 FewShotWOZ 与 FewShotSGD 上的实证实验表明,我们的方法在自动与人工评估上总体优于现有自训练方法。
引用
@article{arxiv.2205.09661,
title = {Self-training with Two-phase Self-augmentation for Few-shot Dialogue Generation},
author = {Wanyu Du and Hanjie Chen and Yangfeng Ji},
journal= {arXiv preprint arXiv:2205.09661},
year = {2022}
}
备注
Findings of EMNLP2022