合成临床文本的生成:系统综述
计算与语言
2025-07-25 v1 人工智能
摘要
生成临床合成文本是解决常见临床自然语言处理问题(如稀疏性和隐私性)的有效方案。本文旨在通过针对三个研究问题(即(i)生成目的,(ii)技术,和(iii)评估方法)进行定量分析,对生成合成医学自由文本进行系统综述。我们检索了PubMed、ScienceDirect、Web of Science、Scopus、IEEE、Google Scholar和arXiv数据库中与生成合成医学非结构化自由文本相关的出版物。在收集的1,398篇文章中,我们识别出94篇相关文章。自2018年以来,合成医学文本的生成受到了广泛关注,其主要目的是文本增强、辅助写作、语料库构建、隐私保护、标注和实用性。Transformer架构是生成文本的主要技术,尤其是GPT系列。另一方面,评估主要有四个方面,包括相似性、隐私性、结构性和实用性,其中实用性是评估生成的合成医学文本最常用的方法。尽管生成的合成医学文本在不同下游自然语言处理任务中表现出作为真实医学文档的中等可能性,但它已被证明是作为增强、补充真实文档的宝贵资产,有助于提高准确性并克服稀疏性/欠采样问题。然而,隐私仍然是生成合成医学文本背后的主要问题,需要更多人工评估来检查是否存在任何敏感信息。尽管如此,合成医学文本生成的进展将大大加速工作流程和管道开发的采用,省去耗时的数据传输法律程序。
引用
@article{arxiv.2507.18451,
title = {Generation of Synthetic Clinical Text: A Systematic Review},
author = {Basel Alshaikhdeeb and Ahmed Abdelmonem Hemedan and Soumyabrata Ghosh and Irina Balaur and Venkata Satagopam},
journal= {arXiv preprint arXiv:2507.18451},
year = {2025}
}