CoDa:面向低资源NLP的基于约束生成的数据增强
计算与语言
2024-04-02 v1
摘要
我们提出了CoDa(基于约束生成的数据增强),一种面向低资源(数据稀缺)NLP的可控、有效且无需训练的数据增强技术。我们的方法基于提示现成的指令遵循大型语言模型(LLM)生成满足一组约束的文本。具体而言,我们从低资源数据集中的每个实例提取一组简单约束,并将其表达为提示以引导LLM生成新颖且多样的训练实例。我们的研究结果表明,遵循下游数据集中简单约束的合成数据可作为高效的增强数据,而CoDa无需复杂的解码时约束生成技术或使用复杂算法进行微调即可实现这一点,后者最终会使模型偏向于少量的训练实例。此外,CoDa是首个为用户提供对增强生成过程显式控制的框架,从而也允许轻松适应多个领域。我们证明了CoDa在跨越3个任务和3种低资源设置的11个数据集上的有效性。CoDa在定性和定量上均优于我们所有的基线,提升幅度为0.12%-7.19%。代码在此处可用:https://github.com/Sreyan88/CoDa
引用
@article{arxiv.2404.00415,
title = {CoDa: Constrained Generation based Data Augmentation for Low-Resource NLP},
author = {Chandra Kiran Reddy Evuru and Sreyan Ghosh and Sonal Kumar and Ramaneswaran S and Utkarsh Tyagi and Dinesh Manocha},
journal= {arXiv preprint arXiv:2404.00415},
year = {2024}
}
备注
Accepted to NAACL 2024 Findings