OphCLIP:面向眼科手术视频-语言预训练的分层检索增强学习框架
计算机视觉与模式识别
2024-11-28 v2
摘要
手术实践涉及复杂的视觉解释、程序技能和先进的医学知识,使得手术视觉-语言预训练(VLP)尤其具有挑战性 due to 这种复杂性和标注数据稀缺的限制。为填补这一差距,我们提出OphCLIP,一个为眼科手术工作流程理解专门设计的分层检索增强视觉-语言预训练框架。OphCLIP利用我们构建的OphVL数据集,这是一个大规模且全面的37.5万个分层结构视频-文本对集合,包含数万种不同的属性组合(手术、阶段/操作/动作、器械、药物以及更高级的方面如眼病原因、手术目标和术后恢复建议等)。这些分层视频-文本对应关系使OphCLIP能够通过将短视频片段与详细叙述性描述以及完整视频与结构化标题对齐,学习细粒度和长期视觉表征,分别捕获复杂的手术细节和高层次的程序见解。我们的OphCLIP还设计了一个检索增强预训练框架,以利用潜在的大规模静默手术程序视频,自动检索语义上相关的内容以增强叙述性视频的表征学习。在针对11个数据集的相位识别和多器械识别评估中,OphCLIP显示出鲁妥的泛化能力和卓越的性能。
引用
@article{arxiv.2411.15421,
title = {OphCLIP: Hierarchical Retrieval-Augmented Learning for Ophthalmic Surgical Video-Language Pretraining},
author = {Ming Hu and Kun Yuan and Yaling Shen and Feilong Tang and Xiaohao Xu and Lin Zhou and Wei Li and Ying Chen and Zhongxing Xu and Zelin Peng and Siyuan Yan and Vinkle Srivastav and Diping Song and Tianbin Li and Danli Shi and Jin Ye and Nicolas Padoy and Nassir Navab and Junjun He and Zongyuan Ge},
journal= {arXiv preprint arXiv:2411.15421},
year = {2024}
}