用于机器人临床场景理解的轻量结构化多模态推理
计算机视觉与模式识别
2025-09-29 v1 人工智能
人机交互
机器人学
摘要
医疗机器人需要强大的多模态感知和推理能力,以确保在动态临床环境中的安全性。当前视觉语言模型(VLMs)展现出强大的通用能力,但在时序推理、不确定性估计以及机器人规划所需的结构化输出方面仍存在局限。我们提出了一种轻量智能体式多模态框架,用于基于视频的场景理解。该框架结合Qwen2.5-VL-3B-Instruct模型与基于SmolAgent的编排层,支持链式思维推理、语音-视觉融合和动态工具调用。该框架生成结构化场景图,并利用混合检索模块实现可解释和自适应推理。在Video-MME基准和自定义临床数据集上的评估显示,与现有最先进VLMs相比,该框架具有竞争力的准确性和更强的鲁棒性,展示了其在机器人辅助手术、患者监测和决策支持中的应用潜力。
引用
@article{arxiv.2509.22014,
title = {Lightweight Structured Multimodal Reasoning for Clinical Scene Understanding in Robotics},
author = {Saurav Jha and Stefan K. Ehrlich},
journal= {arXiv preprint arXiv:2509.22014},
year = {2025}
}
备注
11 pages, 3 figures