基于三元组网络、数据增强与课程学习的少样本文本分类
计算与语言
2021-06-16 v1
摘要
少样本文本分类是一项基础的自然语言处理(NLP)任务,其目标是将文本分类到大量类别中,而每个类别仅给定少量训练样本。本文针对这一少样本、高度多类的文本分类场景,探讨了数据增强——一种特别适合有限数据训练的技术。在四项不同的文本分类任务上,我们发现常见的数据增强技术可使三元组网络(triplet networks)的平均性能提升高达 3.0%。为进一步提升性能,我们提出了一种称为课程数据增强(curriculum data augmentation)的简单训练策略,该策略利用课程学习,先仅在原始样本上训练,随后随着训练推进引入增强数据。我们探索了两阶段与渐进式两种调度方案,并发现与标准单阶段训练相比,课程数据增强训练更快、性能更优,且对增强带来的大量加噪保持鲁棒。
引用
@article{arxiv.2103.07552,
title = {Few-Shot Text Classification with Triplet Networks, Data Augmentation, and Curriculum Learning},
author = {Jason Wei and Chengyu Huang and Soroush Vosoughi and Yu Cheng and Shiqi Xu},
journal= {arXiv preprint arXiv:2103.07552},
year = {2021}
}
备注
To appear at NAACL 2021