SurgVisAgent:用于多功能手术视觉增强的多模态智能体模型
计算机视觉与模式识别
2025-07-04 v1 人工智能
摘要
精准的手术干预对患者安全至关重要,目前已开发出先进的增强算法来辅助外科医生进行决策。尽管取得了显著进展,但这些算法通常是为特定场景下的单一任务而设计的,这限制了它们在复杂现实情况中的有效性。为解决这一局限性,我们提出 SurgVisAgent,一种基于多模态大语言模型 的端到端智能手术视觉智能体。SurgVisAgent 能够动态识别内窥镜图像中的失真类别和严重程度,从而执行多种增强任务,如低光增强、过曝校正、运动模糊消除和烟雾去除。具体而言,为实现卓越的手术场景理解,我们设计了一个提供领域特定知识的先验模型。此外,通过上下文少样本学习和思维链 推理,SurgVisAgent 能够针对各种失真类型和严重程度提供定制化的图像增强,从而满足外科医生的多样化需求。最后,我们构建了一个模拟真实手术失真的综合基准,大量实验表明 SurgVisAgent 超越了传统的单任务模型,凸显了其作为手术辅助统一解决方案的潜力。
引用
@article{arxiv.2507.02252,
title = {SurgVisAgent: Multimodal Agentic Model for Versatile Surgical Visual Enhancement},
author = {Zeyu Lei and Hongyuan Yu and Jinlin Wu and Zhen Chen},
journal= {arXiv preprint arXiv:2507.02252},
year = {2025}
}