中文

探索合成领域:利用基于扩散的模型进行腹腔镜文本到图像生成

图像与视频处理 2023-12-07 v1 人工智能 计算机视觉与模式识别 组织与器官

摘要

合成成像的最新进展为在外科成像领域获取额外数据开辟了机会。这些数据可以提供可靠的补充,通过计算机视觉支持外科应用和决策。特别是图像引导手术领域,如腹腔镜和机器人辅助手术,从合成图像数据集和虚拟手术训练方法中获益匪浅。我们的研究提出了一种直观的方法,利用基于扩散的生成模型从简短的文本提示生成合成腹腔镜图像。我们以胆囊切除术为例,展示了最先进的文本到图像架构在腹腔镜成像背景下的应用。关于保真度和多样性的结果表明,基于扩散的模型可以获取图像引导手术领域的风格和语义知识。一项包含人类评估调查的验证研究强调了我们合成数据的真实感,因为医务人员在包含生成图像的图像池中检测真实图像,导致假阳性率高达 66%。此外,对用于识别手术动作的最先进机器学习模型的研究表明,当使用额外生成的图像进行训练时,性能提升高达 5.20%。总体而言,所达到的图像质量有助于计算机生成图像在外科应用中的使用,并加速其走向成熟。

关键词

引用

@article{arxiv.2312.03043,
  title  = {Navigating the Synthetic Realm: Harnessing Diffusion-based Models for Laparoscopic Text-to-Image Generation},
  author = {Simeon Allmendinger and Patrick Hemmer and Moritz Queisner and Igor Sauer and Leopold Müller and Johannes Jakubik and Michael Vössing and Niklas Kühl},
  journal= {arXiv preprint arXiv:2312.03043},
  year   = {2023}
}