中文

合成数据:如何用于传染病研究?

其他定量生物学 2026-02-12 v1 计算机与社会 机器学习

摘要

在过去三到五年中,为医疗保健相关用途生成机器学习合成数据已成为可能。然而,人们对人工数据集生成可能带来的潜在负面因素表示担忧。这些因素包括生成式人工智能在网络犯罪等领域的潜在滥用、使用深度伪造和假新闻进行欺骗或操纵,以及跨多个市场部门的人类工作岗位被取代。在此,我们考虑了合成数据集当前和未来的积极进展和可能性。合成数据提供了显著的优势,特别是在数据隐私、研究、平衡数据集和减少机器学习模型偏差方面。生成式人工智能是一种能够使用生成模型创建文本、图像、视频或其他数据的人工智能类型。最近对GenAI的兴趣激增,以大语言模型的发明和迅速投入使用为先导。这些计算模型能够实现通用语言生成和其他自然语言处理任务,基于Transformer架构,该架构是从以前的神经网络架构进化而来的飞跃。随着改进的GenAI技术的出现和广泛使用,现在无疑是考虑如何使用合成数据来推进传染病研究的时候了。在这篇评论中,我们旨在概述合成数据在传染病研究中的当前和未来地位。

关键词

引用

@article{arxiv.2407.06211,
  title  = {Synthetic data: How could it be used for infectious disease research?},
  author = {Styliani-Christina Fragkouli and Dhwani Solanki and Leyla J Castro and Fotis E Psomopoulos and Núria Queralt-Rosinach and Davide Cirillo and Lisa C Crossman},
  journal= {arXiv preprint arXiv:2407.06211},
  year   = {2026}
}