中文

用于机器人临床场景理解的轻量结构化多模态推理

计算机视觉与模式识别 2025-09-29 v1 人工智能 人机交互 机器人学

摘要

医疗机器人需要强大的多模态感知和推理能力,以确保在动态临床环境中的安全性。当前视觉语言模型(VLMs)展现出强大的通用能力,但在时序推理、不确定性估计以及机器人规划所需的结构化输出方面仍存在局限。我们提出了一种轻量智能体式多模态框架,用于基于视频的场景理解。该框架结合Qwen2.5-VL-3B-Instruct模型与基于SmolAgent的编排层,支持链式思维推理、语音-视觉融合和动态工具调用。该框架生成结构化场景图,并利用混合检索模块实现可解释和自适应推理。在Video-MME基准和自定义临床数据集上的评估显示,与现有最先进VLMs相比,该框架具有竞争力的准确性和更强的鲁棒性,展示了其在机器人辅助手术、患者监测和决策支持中的应用潜力。

关键词

引用

@article{arxiv.2509.22014,
  title  = {Lightweight Structured Multimodal Reasoning for Clinical Scene Understanding in Robotics},
  author = {Saurav Jha and Stefan K. Ehrlich},
  journal= {arXiv preprint arXiv:2509.22014},
  year   = {2025}
}

备注

11 pages, 3 figures