OphEdit:无需训练的文本导向式眼科手术视频编辑
计算机视觉与模式识别
2026-05-11 v1
摘要
高保真手术视频生成可大大提高医学培训和AI开发水平,但将这些生成模型适用于精确视频编辑仍是一个巨大的挑战。修改手术属性,如器械组织相互作用或程序阶段,由于严格的解剖和时间约束而具有挑战性。在本文中,我们提出了OphEdit,一个用于文本导向式手术视频编辑的新型无需训练框架。我们的方法利用确定性二阶ODE反演流程捕获来自原始视频的注意力值(V)张量。通过在去噪阶段将这些存储的张量选择性地注入到条件Classifier-Free Guidance(CFG)分支中,OphEdit严格保留了眼部复杂的解剖几何结构,同时无缝地将文本驱动的语义修改映射到视频流上。临床评估表明,OphEdit有效地处理了复杂的手术转换,如器械交换和程序变体,具有优异的结构保真度和时间一致性。我们的工作代表了首次将无需训练的视频编辑应用于眼科手术领域,为在无需耗费大量人工录制或高昂模型微调的情况下生成多样化、带注释的医学数据集提供了可扩展解决方案。代码和提示可在https://github.com/ophedit/OphEdit获取。
引用
@article{arxiv.2605.07695,
title = {OphEdit: Training-Free Text-Guided Editing of Ophthalmic Surgical Videos},
author = {Ritul Jangir and Arkya Jyoti Bagchi and Aiman Farooq and Mangalton Okram and Saurabh Seetaram Korgaonkar and Deepak Mishra},
journal= {arXiv preprint arXiv:2605.07695},
year = {2026}
}