中文

EndoGen:条件自回归结肠镜视频生成

计算机视觉与模式识别 2025-07-24 v1 图像与视频处理

摘要

结肠镜视频生成对于推动医学成像技术并提升诊断能力至关重要。然而,此领域的 prior 工作要么仅关注静态图像,缺乏实际应用所需的动态上下文,要么依赖无条件生成,无法为临床医生提供有意义的参考依据。因此,本文提出了首个条件结肠镜视频生成框架,即 EndoGen。具体而言,我们构建了一个基于量化化自回归模型,采用量化化时空网格-帧模式化策略 (SGP)。该方法将生成多个帧的学习重新表述为网格化图像生成模式,有效利用自回归架构在全局依赖建模方面的固有能力。此外,我们提出了语义感知标记遮蔽 (SAT) 机制,通过在生成过程中有选择地聚焦于语义上有意义的区域,来增强模型生成丰富且多样化内容的能力。通过大量实验,我们展示了该框架在生成高质量、条件引导的结肠镜内容方面的有效性,并提升了下游多项任务(如结肠息肉分割)的性能。代码已发布于 https://www.github.com/CUHK-AIM-Group/EndoGen。

关键词

引用

@article{arxiv.2507.17388,
  title  = {EndoGen: Conditional Autoregressive Endoscopic Video Generation},
  author = {Xinyu Liu and Hengyu Liu and Cheng Wang and Tianming Liu and Yixuan Yuan},
  journal= {arXiv preprint arXiv:2507.17388},
  year   = {2025}
}

备注

MICCAI 2025