OphNet:面向眼科手术工作流程理解的大规模视频基准
计算机视觉与模式识别
2024-07-22 v4
摘要
通过视频实现手术场景感知是推进机器人手术、远程手术和 AI 辅助手术至关重要的,尤其是在眼科领域。然而,稀缺且注释丰富的视频数据集的瓶颈,阻碍了针对手术工作流程分析构建智能系统的发展。现有数据集面临规模较小、手术和阶段类别缺乏多样性、缺乏时间局部化注释等挑战。这些限制妨碍了在复杂且多样化的真实世界手术场景中进行动作理解和模型泛化验证。为填补这一差距,我们引入 OphNet,一个大规模、专家标注的视频基准,用于眼科手术工作流程理解。OphNet 的特点包括:1) 覆盖 66 种白内障、青光眼和角膜手术的 2,278 个手术视频,包含 102 个独特手术阶段和 150 项细粒度操作的详细注释。2) 为每个手术、阶段和操作提供顺序和层次化注释,实现全面理解和改进可解释性。3) 时间局部化注释,促进手术工作流程内的时间局部化和预测任务。OphNet 包含约 285 小时的手术视频,规模约为现有最大手术工作流程分析基准的 20 倍。代码和数据集可在 https://minghu0830.github.io/OphNet-benchmark/ 获取。
引用
@article{arxiv.2406.07471,
title = {OphNet: A Large-Scale Video Benchmark for Ophthalmic Surgical Workflow Understanding},
author = {Ming Hu and Peng Xia and Lin Wang and Siyuan Yan and Feilong Tang and Zhongxing Xu and Yimin Luo and Kaimin Song and Jurgen Leitner and Xuelian Cheng and Jun Cheng and Chi Liu and Kaijing Zhou and Zongyuan Ge},
journal= {arXiv preprint arXiv:2406.07471},
year = {2024}
}
备注
Accepted by ECCV 2024