中文

通过提示进行弱监督数据增强以用于对话理解

计算与语言 2022-11-03 v3 人工智能 机器学习

摘要

对话理解任务通常需要大量标注数据才能取得良好性能,这在低资源场景下带来了挑战。为缓解这一障碍,我们通过提示大型预训练语言模型,探索了用于对话理解的少样本数据增强,并提出了一种通过应用弱监督过滤器来迭代增强质量的新方法。我们在 DailyDialog 的情感和行为分类任务以及 Facebook Multilingual Task-Oriented Dialogue 的意图分类任务上评估了我们的方法。在我们的增强数据与少样本真实数据混合上进行微调的模型,能够在两个数据集上接近或超越现有的 SOTA 性能。具体而言,对于 DailyDialog,仅使用 10% 的真实数据,我们的表现即优于使用 100% 数据的当前 SOTA 模型。

关键词

引用

@article{arxiv.2210.14169,
  title  = {Weakly Supervised Data Augmentation Through Prompting for Dialogue Understanding},
  author = {Maximillian Chen and Alexandros Papangelis and Chenyang Tao and Andy Rosenbaum and Seokhwan Kim and Yang Liu and Zhou Yu and Dilek Hakkani-Tur},
  journal= {arXiv preprint arXiv:2210.14169},
  year   = {2022}
}

备注

To appear in SyntheticData4ML @ NeurIPS 2022. 16 pages, 10 figures, 3 tables