基于课程的自训练使数据到文本生成成为更优的小样本学习器
计算与语言
2022-06-07 v1
摘要
尽管文本到文本预训练模型在各种自然语言生成(NLG)任务中取得了成功,但其生成性能在很大程度上受限于下游任务中标注数据的数量,尤其是在数据到文本生成任务中。现有工作大多利用丰富的无标注结构化数据进行无监督预训练以实现任务适配,但未能对源结构化数据与目标文本之间的复杂关系进行建模。因此,我们引入自训练作为比任务适配预训练更优的小样本学习器,它通过预训练模型生成的伪标注数据显式地捕捉这种关系。为缓解自训练过程中低质量伪标注数据的副作用,我们提出一种称为基于课程的自训练(CBST)的新方法,以由文本生成难度决定的重排顺序来有效利用无标注数据。实验结果表明,我们的方法优于微调和任务适配预训练方法,并在数据到文本生成的小样本设定下取得了最先进的性能。
引用
@article{arxiv.2206.02712,
title = {Curriculum-Based Self-Training Makes Better Few-Shot Learners for Data-to-Text Generation},
author = {Pei Ke and Haozhe Ji and Zhenyu Yang and Yi Huang and Junlan Feng and Xiaoyan Zhu and Minlie Huang},
journal= {arXiv preprint arXiv:2206.02712},
year = {2022}
}
备注
Accepted by IJCAI 2022