合成增强:利用合成数据提升超声心动图视觉-语言分割
计算机视觉与模式识别
2023-10-06 v1 人工智能
计算与语言
机器学习
摘要
准确的分割对于基于超声心动图的心血管疾病(CVDs)评估至关重要。然而,超声医师间的差异性和超声图像固有的挑战阻碍了精确分割。通过利用图像与文本模态的联合表示,视觉-语言分割模型(VLSMs)能够融入丰富的上下文信息, potentially 有助于实现准确且可解释的分割。然而,超声心动图中现成数据的缺乏阻碍了 VLSMs 的训练。在本研究中,我们探索使用语义扩散模型(SDMs)生成的合成数据集来增强用于超声心动图分割的 VLSMs。我们使用从超声心动图图像、分割掩码及其元数据中自动提取的若干属性派生的七种不同语言提示,评估了两种流行 VLSMs(CLIPSeg 和 CRIS)的结果。我们的结果表明,在真实图像上微调之前,先在 SDM 生成的合成图像上预训练 VLSMs,可改善指标并加速收敛。代码、配置和提示可在 https://github.com/naamiinepal/synthetic-boost 获取。
引用
@article{arxiv.2309.12829,
title = {Synthetic Boost: Leveraging Synthetic Data for Enhanced Vision-Language Segmentation in Echocardiography},
author = {Rabin Adhikari and Manish Dhakal and Safal Thapaliya and Kanchan Poudel and Prasiddha Bhandari and Bishesh Khanal},
journal= {arXiv preprint arXiv:2309.12829},
year = {2023}
}
备注
Accepted at the 4th International Workshop of Advances in Simplifying Medical UltraSound (ASMUS)