中文

面向高效零样本学习的自引导无噪声数据生成

计算与语言 2023-02-28 v2

摘要

进一步探索大型预训练语言模型(PLMs)的零样本学习潜力正引起越来越多的关注。一种称为基于数据生成的零样本学习的新范式已取得了令人瞩目的成功。在该范式中,由 PLM 合成的数据作为知识的载体,用于训练参数量比 PLM 少几个数量级的任务特定模型,在 PLM 上比基于提示的零样本学习方法实现了更高的性能和效率。该方法的主要障碍是 PLM 合成的数据通常包含大量低质量样本。在此类数据上拟合将极大损害任务特定模型的性能,使其难以可靠部署。以往方法主要通过使用启发式度量(如输出置信度)过滤合成数据,或在人类专家帮助下精炼数据来补救该问题,这伴随着过度的手动调参或高昂成本。本文提出一种新颖的噪声鲁棒重加权框架 SunGen,用于自动为零样本分类问题构建高质量数据。我们的框架具备学习指示数据质量的样本权重的能力,且无需任何人工标注。我们从理论和实证上验证了该方法有助于构建良好质量的合成数据集。值得注意的是,SunGen-LSTM 在八个不同的成熟文本分类任务的平均准确率上比基线相对提升 9.8%。

关键词

引用

@article{arxiv.2205.12679,
  title  = {Self-Guided Noise-Free Data Generation for Efficient Zero-Shot Learning},
  author = {Jiahui Gao and Renjie Pi and Yong Lin and Hang Xu and Jiacheng Ye and Zhiyong Wu and Weizhong Zhang and Xiaodan Liang and Zhenguo Li and Lingpeng Kong},
  journal= {arXiv preprint arXiv:2205.12679},
  year   = {2023}
}

备注

ICLR 2023 camera ready with 23 pages