中文

Colon-Bench:用于全结肠镜检查视频中可扩展密集病变标注的智能体工作流

图像与视频处理 2026-03-27 v1 计算机视觉与模式识别 人机交互

摘要

通过结肠镜检查进行早期筛查对结肠癌预防至关重要,但该领域开发鲁棒的 AI 系统受到缺乏密集标注的长序列视频数据集的制约。现有数据集主要聚焦于单类息肉检测,缺乏评估现代多模态大语言模型(MLLM)所需的丰富空间、时间和语言标注。为填补这一关键空白,我们引入 Colon-Bench,通过一种新颖的多阶段智能体工作流生成。我们的流程无缝整合时间提议、边界框跟踪、AI 驱动的视觉确认和人工在环审查,以可扩展的方式标注全流程视频。由此产生的经验证基准前所未有地全面,涵盖 528 个视频、14 种不同病变类别(包括息肉、溃疡和出血)、超过 300,000 个边界框、213,000 个分割掩码以及 133,000 字的临床描述。我们利用 Colon-Bench 严格评估最先进的 MLLM 在病变分类、开放词汇视频目标分割(OV-VOS)和视频视觉问答(VQA)方面的表现。MLLM 结果表明其在医学领域的定位性能惊人地高,与 SAM-3 相比尤为突出。最后,我们分析了 MLLM 的常见 VQA 错误,提出了一种新颖的"结肠技能"提示策略,在大多数 MLLM 上将零样本性能提升了高达 9.7%。数据集和代码可在 https://abdullahamdi.com/colon-bench 获取。

关键词

引用

@article{arxiv.2603.25645,
  title  = {Colon-Bench: An Agentic Workflow for Scalable Dense Lesion Annotation in Full-Procedure Colonoscopy Videos},
  author = {Abdullah Hamdi and Changchun Yang and Xin Gao},
  journal= {arXiv preprint arXiv:2603.25645},
  year   = {2026}
}

备注

preprint