中文

研究使用 ChatGPT 生成文本进行预训练对下游任务的影响

计算与语言 2023-09-13 v1 人工智能

摘要

近年来,语言模型领域取得了显著进展,特别是随着在从互联网档案提取的大量数据上训练的大型语言模型(LLMs)的出现。这些 LLM(如 ChatGPT)已广泛可用,允许用户为各种目的生成文本,包括文章、随笔、笑话和诗歌。鉴于 LLM 训练于涵盖 Reddit 和 Twitter 等平台的多样化文本来源,可以预见未来的训练数据集也将包含模型自身先前迭代所生成的文本。鉴于此发展,我们的研究旨在调查人工文本在语言模型预训练阶段的影响。具体而言,我们比较分析了使用 CNN/DailyMail 新闻文章预训练的语言模型 RoBERTa 与采用相同文章训练的 ChatGPT,并使用情感分析作为指标,评估它们在三个下游任务上的表现以及潜在的性别偏见。通过一系列实验,我们证明在预训练中使用人工文本对模型在下游任务中的表现或其性别偏见均无显著影响。总之,我们的研究结果表明,在 LLM 自身的预训练过程中纳入其生成的文本,不会对模型在下游任务中的后续表现或潜在性别偏见产生实质性影响。

关键词

引用

@article{arxiv.2309.05668,
  title  = {Studying the impacts of pre-training using ChatGPT-generated text on downstream tasks},
  author = {Sarthak Anand},
  journal= {arXiv preprint arXiv:2309.05668},
  year   = {2023}
}

备注

Master's thesis