HieraSurg: 面向手术视频生成的分层感知扩散模型
计算机视觉与模式识别
2025-06-27 v1
摘要
继扩散模型在通用视频生成领域取得成功之后,手术视频合成已成为一个前景广阔的研究方向。尽管现有方法能够生成高质量视频,但大多数是无条件的,无法保持与手术动作和阶段的一致性,缺乏事实模拟所需的手术理解和细粒度引导。针对这些挑战,我们提出了 HieraSurg,一个由两个专用扩散模型组成的分层感知手术视频生成框架。给定一个手术阶段和初始帧,HieraSurg 首先通过分割预测模型预测未来的粗粒度语义变化。然后,由第二阶段模型通过细粒度视觉特征增强这些时间分割图,从而在视频空间中进行有效的纹理渲染和语义信息整合。我们的方法利用了多个抽象层次的手术信息,包括手术阶段、动作三元组和全景分割图。在胆囊切除术手术视频生成上的实验结果表明,该模型在定量和定性方面均显著优于先前的工作,展现出强大的泛化能力和生成更高帧率视频的能力。当提供现有分割图时,该模型表现出特别精细的遵循能力,这表明了其在实际手术应用中的潜力。
引用
@article{arxiv.2506.21287,
title = {HieraSurg: Hierarchy-Aware Diffusion Model for Surgical Video Generation},
author = {Diego Biagini and Nassir Navab and Azade Farshad},
journal= {arXiv preprint arXiv:2506.21287},
year = {2025}
}
备注
Accepted at MICCAI 2025