作为属性化训练数据生成器的大语言模型:多样性与偏差之谈
计算与语言
2023-10-19 v2 人工智能
机器学习
摘要
大语言模型(LLM)近来被用作各类自然语言处理(NLP)任务的训练数据生成器。尽管先前研究已探索了使用生成数据训练模型的不同方法,它们通常依赖于简单的类条件提示,这可能限制生成数据的多样性并继承 LLM 的系统性偏差。因此,我们研究了以多样化属性提示(例如指定长度与风格等属性)进行训练数据生成,其有潜力产生多样化且具属性的生成数据。我们的研究聚焦于具有高基数与多领域的数据集,其中我们证明属性化提示在所得模型性能方面优于简单类条件提示。此外,我们呈现了一项涵盖偏差、多样性与效率等关键方面的数据生成综合实证研究,并强调三点关键观察:首先,由简单提示合成的数据集表现出显著偏差,如地域偏差;其次,属性多样性在提升模型性能中起关键作用;最后,属性化提示仅使用后者所关联 ChatGPT 查询成本的 5% 便达到了简单类条件提示的性能。数据与代码发布于 \url{https://github.com/yueyu1030/AttrPrompt}。
引用
@article{arxiv.2306.15895,
title = {Large Language Model as Attributed Training Data Generator: A Tale of Diversity and Bias},
author = {Yue Yu and Yuchen Zhuang and Jieyu Zhang and Yu Meng and Alexander Ratner and Ranjay Krishna and Jiaming Shen and Chao Zhang},
journal= {arXiv preprint arXiv:2306.15895},
year = {2023}
}
备注
Accepted to NeurIPS 2023 (Datasets and Benchmarks Track)