先移植后再生:文本数据增强的新范式
计算与语言
2025-09-16 v3 人工智能
摘要
数据增强是深度学习中的一项关键技术。传统的回译等方法通常侧重于词汇层面的改写,主要产生语义相同的变体。虽然大型语言模型通过其“知识涌现”能力增强了文本增强,但控制这些输出的风格和结构仍然具有挑战性,并且需要精细的提示工程。在本文中,我们提出了 LMTransplant,一种利用大语言模型的新型文本增强范式。LMTransplant 的核心思想是先移植后再生:将种子文本整合到大语言模型扩展的上下文中,并要求大语言模型基于扩展后的上下文重新生成一个变体。这种策略允许模型通过充分利用大语言模型中嵌入的知识,创造出更多样化、更具创造性的内容层面变体,同时保留原始文本的核心属性。我们在各种文本相关任务上评估了 LMTransplant,证明了其优于现有文本增强方法的性能。此外,随着增强数据规模的扩大,LMTransplant 展现出卓越的可扩展性。
引用
@article{arxiv.2508.14723,
title = {Transplant Then Regenerate: A New Paradigm for Text Data Augmentation},
author = {Guangzhan Wang and Hongyu Zhang and Beijun Shen and Xiaodong Gu},
journal= {arXiv preprint arXiv:2508.14723},
year = {2025}
}
备注
Accepted by EMNLP 2025