EndoChat:用于内镜手术的扎根多模态大语言模型
计算机视觉与模式识别
2025-03-18 v2
摘要
最近,多模态大语言模型(MLLMs)在计算机辅助诊断和决策方面展现出巨大的潜力。在机器人辅助手术领域,MLLMs 可作为有效的手术训练和指导工具。然而,目前缺乏专为临床应用中手术场景理解而设计的 MLLMs。本文引入 EndoChat 以解决手术场景理解中面临的各种对话范式和子任务。为训练 EndoChat,我们通过一种新颖的管道构建 Surg-396K 数据集,系统性地提取手术信息并基于收集的大规模内镜手术数据集生成结构化标注。此外,我们引入多尺度视觉标记交互机制和基于视觉对比的推理机制,以增强模型的表示学习和推理能力。我们的模型在五种对话范式和八个手术场景理解任务上实现了最先进的性能。此外,我们对专业外科医生进行了评估,大多数外科医生对与 EndoChat 合作持积极意见。总体而言,这些结果表明 EndoChat 有望显著推动机器人辅助手术的训练和自动化。
引用
@article{arxiv.2501.11347,
title = {EndoChat: Grounded Multimodal Large Language Model for Endoscopic Surgery},
author = {Guankun Wang and Long Bai and Junyi Wang and Kun Yuan and Zhen Li and Tianxu Jiang and Xiting He and Jinlin Wu and Zhen Chen and Zhen Lei and Hongbin Liu and Jiazheng Wang and Fan Zhang and Nicolas Padoy and Nassir Navab and Hongliang Ren},
journal= {arXiv preprint arXiv:2501.11347},
year = {2025}
}