ABEX:通过扩展抽象描述实现低资源自然语言理解的数据增强
计算与语言
2024-06-07 v1 人工智能
摘要
我们提出了ABEX,一种新颖且有效的生成式数据增强方法,用于低资源自然语言理解(NLU)任务。ABEX基于“抽象与扩展”(ABstract-and-EXpand),这是一种生成输入文档多种形式的新范式——我们首先将文档转换为其简洁的抽象描述,然后基于扩展所得抽象来生成新文档。为了学习扩展抽象描述的任务,我们首先在大规模合成数据集上使用抽象-文档对训练BART。接下来,为了生成文档的抽象描述,我们提出了一种基于编辑AMR图的简单、可控且无需训练的方法。ABEX兼具两者优点:通过从抽象表示进行扩展,它保留了文档的原始语义属性(如风格和含义),从而保持与原始标签和数据分布的对齐。同时,阐述抽象描述的基本过程促进了多样化的生成。我们在涵盖12个数据集和4种低资源设置的4个NLU任务上展示了ABEX的有效性。ABEX在质量上优于所有基线,改进幅度为0.04%至38.8%。在定性方面,ABEX在上下文和长度多样性方面优于文献中所有先前方法。
引用
@article{arxiv.2406.04286,
title = {ABEX: Data Augmentation for Low-Resource NLU via Expanding Abstract Descriptions},
author = {Sreyan Ghosh and Utkarsh Tyagi and Sonal Kumar and C. K. Evuru and S Ramaneswaran and S Sakshi and Dinesh Manocha},
journal= {arXiv preprint arXiv:2406.04286},
year = {2024}
}
备注
ACL 2024 Main Conference. Code and data: https://github.com/Sreyan88/ABEX