面向低资源领域任务的检索增强数据增强
计算与语言
2024-02-22 v1 人工智能
机器学习
摘要
尽管最近的语言模型在各种任务上取得了巨大成功,但在训练数据有限的低资源设置中,它们的性能会严重下降。许多现有工作通过从训练数据生成合成数据然后在其上训练模型来解决这个问题,最近利用大语言模型 (LLMs) 进行此类操作。然而,在低资源设置中,用于数据增强的种子数据样本量非常小,这使得生成的样本次优且缺乏多样性。为应对这一挑战,我们提出了一种新方法,通过结合其他数据集的大量示例以及给定的训练数据来增强训练数据。具体而言,我们首先根据与给定种子数据的相似性,从其他数据集中检索相关实例(如它们的输入 - 输出对或上下文),然后提示 LLMs 利用原始样本和检索样本内部及之间的上下文信息生成新样本。这种方法可以确保生成的数据不仅相关,而且比仅使用有限的种子数据所能实现的更加多样。我们在低资源设置下的多个数据集上验证了所提出的检索增强数据增强 (RADA) 框架,涵盖了训练时和测试时的数据增强场景,其表现优于现有的基于 LLM 的数据增强基线方法。
引用
@article{arxiv.2402.13482,
title = {Retrieval-Augmented Data Augmentation for Low-Resource Domain Tasks},
author = {Minju Seo and Jinheon Baek and James Thorne and Sung Ju Hwang},
journal= {arXiv preprint arXiv:2402.13482},
year = {2024}
}