中文

基于扩散模型的腹式手术视频交互式生成

图像与视频处理 2024-06-12 v1 人工智能 计算机视觉与模式识别 机器学习

摘要

生成式 AI,尤其是合成视觉数据的生成,为手术培训提供了巨大的潜力,能够为模拟环境提供真实可信的视觉效果。当前的培训方法主要依赖阅读材料和观看实手术,此类方式耗时且不够实际。本文通过采用扩散模型结合零样本视频扩散方法,实现了通过文本指定手术动作并借助工具位置的分割掩码引导,交互式生成逼真的腹式手术图像和视频。我们采用公开的 Cholec 数据集系列进行实验评估,并使用手术动作识别模型以及工具生成的像素级 F1 分数来评估生成图像的保真度和事实正确性。我们实现了 FID 为 38.097,F1 分数为 0.71 的优异性能。

关键词

引用

@article{arxiv.2406.06537,
  title  = {Interactive Generation of Laparoscopic Videos with Diffusion Models},
  author = {Ivan Iliash and Simeon Allmendinger and Felix Meissen and Niklas Kühl and Daniel Rückert},
  journal= {arXiv preprint arXiv:2406.06537},
  year   = {2024}
}

备注

7 pages, 4 figures