中文

ColoDiff:将动态一致性与内容感知集成于结肠镜视频生成

计算机视觉与模式识别 2026-02-27 v1 人工智能

摘要

结肠镜视频生成能够提供动态、信息丰富的数据,对诊断肠道疾病尤其重要,尤其在数据稀缺的场景下。高质量视频生成要求保持时序一致性并精确控制临床属性,但面临不规则肠道结构、疾病表征多样以及多种成像模态等挑战。为此,我们提出ColoDiff框架,生成动态一致且内容感知的结肠镜视频,旨iated缓解数据不足并辅助临床分析。在帧间层面,TimeStream模块通过跨帧标记化机制将时序依赖性从视频序列中解耦,使模型能够在不规则肠道结构下进行复杂的动态建模。在帧内层面,内容感知模块引入噪声注入嵌入和可学习原型,实现对临床属性的精确控制,突破扩散模型粗糙引导的局限。此外,ColoDiff采用非马尔可夫采样策略,可将步骤数降低超过90%,实现实时生成。我们在三个公开数据集和一个医院数据库上评估了ColoDiff,基于生成指标以及疾病诊断、模态识别、肠道准备评分和病灶分割等下游任务。大量实验表明,ColoDiff生成的视频在过渡平滑、动态丰富方面表现优异。ColoDiff代表了可控结肠镜视频生成的一个尝试,揭示了合成视频在补充真实表征和缓解临床场景数据稀缺方面的潜力。

关键词

引用

@article{arxiv.2602.23203,
  title  = {ColoDiff: Integrating Dynamic Consistency With Content Awareness for Colonoscopy Video Generation},
  author = {Junhu Fu and Shuyu Liang and Wutong Li and Chen Ma and Peng Huang and Kehao Wang and Ke Chen and Shengli Lin and Pinghong Zhou and Zeju Li and Yuanyuan Wang and Yi Guo},
  journal= {arXiv preprint arXiv:2602.23203},
  year   = {2026}
}