SurGen:面向手术视频生成的文本引导扩散模型
计算机视觉与模式识别
2024-09-26 v3 人工智能
计算与语言
机器学习
摘要
扩散式视频生成模型已取得显著进展,生成的输出在视觉保真度、时序连贯性和用户控制方面表现出改善。这些进展为通过更真实、更具多样性和更具互动性的仿真环境,提升手术教育水平,具有巨大潜力。本研究中,我们引入 SurGen,一个专为手术视频合成设计的文本引导扩散模型。SurGen 在现有手术视频生成模型中实现了最高分辨率和最长时长。我们通过标准图像和视频生成指标验证输出的视觉与时序质量。此外,我们使用在手术数据上训练的深度学习分类器来评估其与相应文本提示之间的对齐程度。我们的结果表明,扩散模型有望作为手术学习者的有价值教育工具。
引用
@article{arxiv.2408.14028,
title = {SurGen: Text-Guided Diffusion Model for Surgical Video Generation},
author = {Joseph Cho and Samuel Schmidgall and Cyril Zakka and Mrudang Mathur and Dhamanpreet Kaur and Rohan Shad and William Hiesinger},
journal= {arXiv preprint arXiv:2408.14028},
year = {2024}
}