Endora:作为内窥镜模拟器的视频生成模型
计算机视觉与模式识别
2024-03-19 v1
摘要
生成模型有望彻底改变医学教育、机器人辅助手术以及用于机器学习的数据增强。尽管在生成 2D 医学图像方面取得了进展,但临床视频生成这一复杂领域在很大程度上仍未被开发。本文介绍了 Endora,一种生成模拟临床内窥镜场景的医学视频的创新方法。我们提出了一种新颖的生成模型设计,将精心设计的时空视频 Transformer 与先进的 2D 视觉基础模型先验相结合,在视频生成过程中显式地对时空动态进行建模。我们还率先使用视频生成模型为内窥镜模拟建立了首个公开基准,为此调整了现有的 SOTA 方法。Endora 在生成内窥镜视频方面展现出卓越的视觉质量,在广泛的测试中超越了 SOTA 方法。此外,我们探索了这种内窥镜模拟器如何赋能下游视频分析任务,甚至生成具有多视角一致性的 3D 医学场景。简而言之,Endora 标志着生成式 AI 在临床内窥镜研究部署方面的重大突破,为医学内容生成的进一步发展奠定了坚实基础。更多详情,请访问我们的项目页面:https://endora-medvidgen.github.io/。
引用
@article{arxiv.2403.11050,
title = {Endora: Video Generation Models as Endoscopy Simulators},
author = {Chenxin Li and Hengyu Liu and Yifan Liu and Brandon Y. Feng and Wuyang Li and Xinyu Liu and Zhen Chen and Jing Shao and Yixuan Yuan},
journal= {arXiv preprint arXiv:2403.11050},
year = {2024}
}
备注
Project page: https://endora-medvidgen.github.io/