中文

DualAlign:生成具有临床依据的合成数据

机器学习 2025-09-16 v1 人工智能 计算与语言 计算机与社会

摘要

鉴于真实世界 EHR 的严格隐私限制、标注罕见疾病数据的有限可用性以及观测数据集中的系统性偏差,合成临床数据对于推进医疗 AI 变得日益重要。尽管大型语言模型 (LLM) 能够生成流畅的临床文本,但生成既逼真又具有临床意义的合成数据仍然具有挑战性。我们引入了 DualAlign,这是一个通过双重对齐来增强统计保真度和临床合理性的框架:(1) 统计对齐,以患者人口统计学特征和风险因素为条件进行生成;(2) 语义对齐,结合真实世界的症状轨迹来指导内容生成。以阿尔茨海默病 (AD) 为案例研究,DualAlign 生成了具有上下文依据的症状级句子,能更好地反映真实世界的临床文档。使用 DualAlign 生成的数据与人工标注数据的组合来微调 LLaMA 3.1-8B 模型,相较于仅使用黄金数据或无引导的合成基线训练的模型,获得了显著的性能提升。尽管 DualAlign 未能完全捕捉纵向复杂性,但它为生成具有临床依据且保护隐私的合成数据提供了一种实用方法,以支持低资源临床文本分析。

关键词

引用

@article{arxiv.2509.10538,
  title  = {DualAlign: Generating Clinically Grounded Synthetic Data},
  author = {Rumeng Li and Xun Wang and Hong Yu},
  journal= {arXiv preprint arXiv:2509.10538},
  year   = {2025}
}