中文

合成数据足够吗?重新思考儿童罕见疾病识别中的数据稀缺问题

计算机视觉与模式识别 2026-05-22 v1

摘要

儿童罕见遗传疾病患者常呈现独特的面部表型,但由于数据极度稀缺、隐私限制以及儿童领域数据共享有限的挑战,仍难以开发出用于早期诊断的计算机视觉系统。这些挑战不仅阻碍了自动化诊断,也限制了为临床遗传咨询提供视觉资源的可得性。尽管已有工作表明合成数据可用于增强真实数据集并保留表型级语义,但合成数据alone是否足以用于学习仍是未知的。在本工作中,我们研究了儿童罕见疾病识别的合成数据alone情形。在受控的实验设置下,我们在不断增加规模的情况下仅使用表型感知的合成面部图像训练模型。我们发现,合成数据alone训练在多种backbone上达到与真实数据训练相当的性能,这表明高保真合成数据可以近似临床意义的分布。这些发现进一步支持将儿童面部合成图像用作隐私保护资源,以支持遗传教育和咨询,促进临床医生培训和患者沟通。我们的结果凸显了计算机视觉在提高数据效率和扩大儿童 healthcare 中可获取视觉工具方面的潜力。

关键词

引用

@article{arxiv.2605.22767,
  title  = {Synthetic Data Alone is Enough? Rethinking Data Scarcity in Pediatric Rare Disease Recognition},
  author = {Ganlin Feng and Yuxi Long and Erin Lou and Lianghong Chen and Zihao Jing and Pingzhao Hu and Wei Xu},
  journal= {arXiv preprint arXiv:2605.22767},
  year   = {2026}
}

备注

CVPR 2026 CV4CHL workshop