基于LLM的文本增强中多样性激励对样本多样性及下游模型性能的影响
计算与语言
2024-12-03 v3
摘要
最新的生成式大语言模型(LLMs)已在数据增强任务中得到应用,即对少量文本样本进行LLM改写,然后用于微调下游模型。然而,仍需更多研究来评估不同的提示、种子数据选择策略、过滤方法或模型设置如何影响改写数据的质量(及下游模型)。本研究探讨了三种在众包中已确立的文本多样性激励方法:禁忌词、基于先前离群解的提示,以及基于先前离群解的链式提示。将这些激励方法作为指令的一部分用于增强文本数据集的LLM,我们衡量了它们对生成文本的词汇多样性及下游模型性能的影响。我们比较了在5种不同LLM、6个数据集和2个下游模型上的效果。结果表明,禁忌词对多样性的提升最大,但使用提示时下游模型性能最高。
引用
@article{arxiv.2401.06643,
title = {Effects of diversity incentives on sample diversity and downstream model performance in LLM-based text augmentation},
author = {Jan Cegin and Branislav Pecher and Jakub Simko and Ivan Srba and Maria Bielikova and Peter Brusilovsky},
journal= {arXiv preprint arXiv:2401.06643},
year = {2024}
}
备注
ACL'24 version, 24 pages