中文

利用大语言模型生成合成数据以提升基于BERT的神经网络的性能

计算与语言 2024-05-14 v1 人工智能

摘要

影响医疗保健的一个重要问题是缺乏可用的专家。机器学习(ML)模型可以通过辅助诊断患者来解决这个问题。然而,创建足够大的数据集来训练这些模型成本高昂。我们评估了大语言模型(LLMs)用于数据创建的能力。以自闭症谱系障碍(ASD)为例,我们提示ChatGPT和GPT-Premium生成了4,200个合成观测数据,以扩充现有的医疗数据。我们的目标是标记与自闭症标准相对应的行为,并通过合成训练数据提高模型准确性。我们使用了一个在生物医学文献上预训练的BERT分类器来评估模型之间的性能差异。从LLM生成的数据中随机抽取的样本(N=140)由临床医生评估,发现包含83%的正确示例-标签对。数据增强使召回率提高了13%,但精确率下降了16%,这与配对数据质量更高但准确性更低相关。未来的工作将分析不同的合成数据特征如何影响机器学习结果。

关键词

引用

@article{arxiv.2405.06695,
  title  = {Utilizing Large Language Models to Generate Synthetic Data to Increase the Performance of BERT-Based Neural Networks},
  author = {Chancellor R. Woolsey and Prakash Bisht and Joshua Rothman and Gondy Leroy},
  journal= {arXiv preprint arXiv:2405.06695},
  year   = {2024}
}

备注

Published in 2024 American Medical Informatics Association (AMIA) Summit March 18-21