利用合成数据增强临床文档:依赖生成模型提高准确率
计算与语言
2024-06-12 v1 人工智能
机器学习
摘要
准确且完整的临床文档对于提供高质量的医疗护理、促进医护人员之间的有效沟通以及确保符合监管要求至关重要。然而,手动转录和数据录入过程可能耗时且容易出错,且容易产生不一致,导致医疗记录不完整或不准确。本文提出一种新方法,通过利用合成数据生成技术来生成逼真且多样化的临床稿件来增强临床文档。我们呈现一种方法,结合生成对抗网络(GAN)和变分自编码器(VAE)等最先进的生成模型,与真实世界的临床稿件及其他形式的临床数据一起生成合成稿件。这些合成稿件然后可以用于补充现有的文档工作流程,为自然语言处理模型提供额外的训练数据,并实现更准确和更高效的转录过程。通过在大型匿名化临床稿件数据集上的大量实验,我们证明了该方法在生成高质量合成稿件方面的有效性。定量评估指标,包括困惑度得分和BLEU得分,以及来自领域专家的定性评估,验证了所生成合成稿件的忠实性和实用性。我们的发现突显了合成数据生成在解决临床文档挑战方面的潜力,改善患者护理,减少行政负担,并提高医疗系统的效率。
引用
@article{arxiv.2406.06569,
title = {Enhancing Clinical Documentation with Synthetic Data: Leveraging Generative Models for Improved Accuracy},
author = {Anjanava Biswas and Wrick Talukdar},
journal= {arXiv preprint arXiv:2406.06569},
year = {2024}
}