合成数据用作验证集
计算机视觉与模式识别
2023-10-25 v1 人工智能
摘要
本研究利用合成数据作为验证集,以减少过拟合并简化人工智能开发中最优模型的选择。尽管合成数据已被用于扩充训练集,但我们发现合成数据也能显著丰富验证集的多样性,在诸如医疗等数据通常有限、敏感且来自域外来源(即医院)的领域具有显著优势。在本研究中,我们展示了合成数据在CT(计算机断层扫描)体积中早期癌症检测的有效性:生成合成肿瘤并将其叠加到健康器官上,从而创建用于严格验证的大规模数据集。使用合成数据作为验证可提升人工智能在域内和域外测试集上的鲁棒性。此外,我们建立了一种新的持续学习框架,该框架在带有合成肿瘤的域外数据流上持续训练人工智能模型。在动态扩展的合成数据上训练和验证的人工智能模型能够持续优于仅在真实世界数据上训练和验证的模型。具体而言,在域内数据集上评估时,肝脏肿瘤分割的DSC分数从26.7%(95% CI:22.6%-30.9%)提升至34.5%(30.8%-38.2%),在域外数据集上从31.1%(26.0%-36.2%)提升至35.4%(32.1%-38.7%)。重要的是,在识别CT体积中极微小肝脏肿瘤(半径 < 5mm)时性能提升尤为显著,域内数据集上灵敏度从33.1%提升至55.4%,域外数据集上从33.9%提升至52.3%,证明了其在癌症早期检测中的有效性。从训练和验证两个视角应用合成数据,指明了在应对不同域数据时增强人工智能鲁棒性的一个有前景的途径。
引用
@article{arxiv.2310.16052,
title = {Synthetic Data as Validation},
author = {Qixin Hu and Alan Yuille and Zongwei Zhou},
journal= {arXiv preprint arXiv:2310.16052},
year = {2023}
}