中文

HeartBeat:基于多模态条件引导的可控超声心动图视频合成

计算机视觉与模式识别 2024-07-08 v2

摘要

超声心动图(ECHO)视频在心脏检查中广泛应用。在临床实践中,这一程序严重依赖于操作员的经验,需要多年的训练,可能需要深度学习系统的帮助以提高准确性和效率。然而,获取足够定制化数据(例如异常情况)进行初学者训练和深度模型开发在临床上几乎不可能。因此,实现可控的ECHO视频合成备受青睐。本文提出一种新型基于扩散模型的框架,命名为HeartBeat,以实现可控且高保真度的ECHO视频合成。我们的核心贡献主要包括:首先,HeartBeat作为统一框架,能够同时感知多模态条件以引导可控生成;其次,我们将多模态条件分解为局部和全局条件,分别提供细粒度和粗粒度控制的插入策略,具有可组合和灵活性;通过组合多模态控制信号,用户可以根据自己的想象合成符合心理图像的ECHO视频;第三,我们提出采用两阶段训练方案,以解耦视觉概念与时间动态学习,简化模型训练。还有一点值得注意的是,HeartBeat能够轻松地针对遮罩引导的心脏MRI合成进行few-shot推广,展示了其向更广泛应用的可扩展性。在两个公开数据集上的大量实验表明,所提出的HeartBeat方法有效。

关键词

引用

@article{arxiv.2406.14098,
  title  = {HeartBeat: Towards Controllable Echocardiography Video Synthesis with Multimodal Conditions-Guided Diffusion Models},
  author = {Xinrui Zhou and Yuhao Huang and Wufeng Xue and Haoran Dou and Jun Cheng and Han Zhou and Dong Ni},
  journal= {arXiv preprint arXiv:2406.14098},
  year   = {2024}
}

备注

Accepted by MICCAI 2024