STA:用于改进文本分类的自控文本增强
计算与语言
2023-02-27 v1 人工智能
机器学习
摘要
尽管机器学习近期取得了进展,许多任务仍涉及低数据量场景,这使得解决自然语言问题变得困难。近来,自然语言处理(NLP)领域出现了许多文本增强技术,可用新样本丰富训练数据,但它们并非没有缺陷。例如,简单的基于规则的启发式方法有效,但相对于原始文本缺乏语义内容与句法结构的多样性。另一方面,更复杂的深度学习方法可能导致文本内在意义的极端偏移,并向训练数据引入不想要的噪声。为了更可靠地控制增强样本的质量,我们引入了一种最先进的方法——自控文本增强(STA)。我们的方法通过引入自检过程严格控制生成过程,以确保生成的样本保留原始文本的语义内容。在多个基准数据集上的实验结果表明,STA大幅优于现有最先进技术,而定性分析揭示生成的样本既在词汇上多样,又在语义上可靠。
引用
@article{arxiv.2302.12784,
title = {STA: Self-controlled Text Augmentation for Improving Text Classifications},
author = {Congcong Wang and Gonzalo Fiz Pontiveros and Steven Derby and Tri Kurniawan Wijaya},
journal= {arXiv preprint arXiv:2302.12784},
year = {2023}
}