中文

DepthPilot:从可控性到可解释性的结肠镜视频生成

计算机视觉与模式识别 2026-04-30 v1 人工智能

摘要

可控的医学视频生成已取得显著进展,但仍缺乏可解释性,这需要生成内容与物理先验及真实临床表现相吻合。为推进从单纯的可控性向可解释性的边界拓展,我们提出DepthPilot,这是首个用于结肠镜视频生成的可解释框架。本工作通过两种协同范式推进可信生成。为实现显式的几何 grounding,DepthPilot 设计了先验分布对齐策略,通过参数高效微调将深度约束注入扩散主干网络,以确保解剖学忠实性。为在这些几何约束下增强内在非线性建模,DepthPilot 采用自适应样条去噪模块,用可学习的样条函数取代固定线性权重,以捕捉复杂的时空动力学。跨三大公开数据集和内部临床数据的广泛评估表明,DepthPilot 能够稳健地生成物理一致的视频。其在所有基准测试中实现 FID 分数低于 15,并在临床医生评估中名列前茅,弥合了“视觉上逼真”与“临床上可解释”之间的鸿沟。此外,DepthPilot 生成的视频预计可支持可靠的 3D 重建,促进手术导航和盲区识别,奠定结肠世界模型的基础。

关键词

引用

@article{arxiv.2604.26232,
  title  = {DepthPilot: From Controllability to Interpretability in Colonoscopy Video Generation},
  author = {Junhu Fu and Ke Chen and Weidong Guo and Shuyu Liang and Jie Xu and Chen Ma and Kehao Wang and Shengli Lin and Zeju Li and Yuanyuan Wang and Yi Guo and Shuo Li},
  journal= {arXiv preprint arXiv:2604.26232},
  year   = {2026}
}