Synthetic4Health:生成带注释的合成临床信函
计算与语言
2024-09-17 v1 人工智能
摘要
由于临床信函包含敏感信息,临床相关数据集无法广泛应用于模型训练、医学研究和教学。本研究旨在生成可靠、多样且去标识化的合成临床信函。为实现这一目标,我们探索了不同的预训练语言模型(PLMs)用于掩码和文本生成。之后,我们基于高性能模型Bio\_ClinicalBERT,并尝试了不同的掩码策略。我们采用定性和定量方法进行评估。此外,还实现了一个下游任务——命名实体识别(NER),以评估这些合成信函的可用性。结果表明:1)仅编码器模型优于编码器-解码器模型。2)在仅编码器模型中,当临床信息得以保留时,在通用语料上训练的模型与在临床数据上训练的模型表现相当。3)此外,保留临床实体和文档结构与简单微调模型相比,更符合我们的目标。4)不同的掩码策略会影响合成临床信函的质量。掩码停用词有积极影响,而掩码名词或动词则有负面影响。5)在评估方面,BERTScore应作为主要的定量评估指标,其他指标作为补充参考。6)上下文信息对模型的理解影响不大,因此合成临床信函有潜力在下游任务中替代原始信函。
关键词
引用
@article{arxiv.2409.09501,
title = {Synthetic4Health: Generating Annotated Synthetic Clinical Letters},
author = {Libo Ren and Samuel Belkadi and Lifeng Han and Warren Del-Pinto and Goran Nenadic},
journal= {arXiv preprint arXiv:2409.09501},
year = {2024}
}
备注
ongoing work, 48 pages