中文

基于单眼内镜视频的无训练代理式推理 4D 表示

计算机视觉与模式识别 2026-04-02 v1

摘要

时空推理是人工智能 (AI) 在软组织手术中至关重要的能力,为智能辅助系统和自主机器人铺平了道路。虽然 2D 视觉-语言模型在理解手术视频方面显示出日益增大的潜力,但手术场景的空间复杂性表明,推理系统可能从显式 4D 表示中受益。本文提出了一个为手术智能体提供时空工具的框架,基于显式 4D 表示,使 AI 系统能够在时间和 3D 空间中对其自然语言推理进行 grounding。利用点跟踪、深度和分割模型,我们开发了一个具有时空一致性工具和组织语义的连贯 4D 模型。随后,多模态大语言模型 (MLLM) 充当基于显式 4D 表示(例如轨迹)派生的工具上的智能体,且无需任何微调。我们在 134 个临床相关问题的数据集上评估了该方法,发现通用推理底层模型与我们的 4D 表示的组合显著提升了时空理解能力,使其能够进行 4D grounding。我们展示,无需额外训练,即可从 2D MLLM 和 3D 计算机视觉模型中“装配”时空智能。代码、数据和示例均可用于 https://tum-ai.github.io/surg4d/。

关键词

引用

@article{arxiv.2604.00867,
  title  = {A 4D Representation for Training-Free Agentic Reasoning from Monocular Laparoscopic Video},
  author = {Maximilian Fehrentz and Nicolas Stellwag and Robert Wiebe and Nicole Thorisch and Fabian Grob and Patrick Remerscheid and Ken-Joel Simmoteit and Benjamin D. Killeen and Christian Heiliger and Nassir Navab},
  journal= {arXiv preprint arXiv:2604.00867},
  year   = {2026}
}