在保持准确性的同时提升多样性:基于大型语言模型与人类干预的文本数据生成
计算与语言
2023-08-11 v1
摘要
大型语言模型(LLMs)可用于生成文本数据以训练和评估其他模型。然而,利用 LLMs 创建高质量数据集可能具有挑战性。在本工作中,我们探索人机协作以促进基于 LLM 的文本数据生成中的高多样性和高准确性。我们首先考察了两种使文本生成多样化的方法:1)logit 抑制,其最小化已频繁生成的语种之生成;2)温度采样,其拉平 token 采样概率。我们发现多样化方法能够提升数据多样性,但往往以数据准确性(即文本与标签适用于目标领域)为代价。为解决此问题,我们考察了两种人类干预:1)标签替换(LR),纠正错位的标签;2)超出范围过滤(OOSF),移除超出用户兴趣领域或所考虑标签均不适用的实例。通过预言机研究,我们发现 LR 将使用多样化数据集训练的模型的绝对准确性提升了 14.4%。此外,我们发现某些使用带 LR 干预生成的数据训练的模型优于基于 LLM 的少样本分类。相比之下,OOSF 在提升模型准确性方面无效,意味着未来在人环文本数据生成方面仍需开展工作。
引用
@article{arxiv.2306.04140,
title = {Increasing Diversity While Maintaining Accuracy: Text Data Generation with Large Language Models and Human Interventions},
author = {John Joon Young Chung and Ece Kamar and Saleema Amershi},
journal= {arXiv preprint arXiv:2306.04140},
year = {2023}
}
备注
Accepted as a long paper at ACL 2023