中文

RVLM:具有自适应深度的递归视觉语言模型

计算机视觉与模式识别 2026-03-26 v1

摘要

医学AI系统面临两个根本性的局限性。首先,常规的视觉语言模型(VLM)进行单次推理,生成的黑箱预测无法在临床层面上进行审计或解释。其次,依赖固定迭代预算的迭代推理系统会在简单案例中浪费计算资源,而对复杂案例则不足。我们提出了统一的框架以解决这两个问题。RVLM将单次推理替换为迭代的生成-执行循环:在每一步,模型编写Python代码、调用视觉子代理、操作图像并累积证据。每个诊断论断都由可执行代码支撑,满足医学AI治理框架中可审计性的要求。RRouter使迭代深度自适应:轻量级控制器从任务复杂度特征中预测最优预算,然后监控推理进展并在推理停滞时提前终止。我们在BraTS 2023脑瘤(脑部MRI)和MIMIC-CXR(胸部X光)数据集上进行评估,使用Gemini 2.5 Flash,无需微调。在多次运行中,RVLM在显著发现(如肿块存在和增强)方面表现出高一致性,并且可以检测到液体抵抗反磁恢复(FLAIR)信号特征与分割边界之间的跨模态偏差。在MIMIC-CXR上,它生成结构化报告并正确识别了特定视角的伪影。代码:https://github.com/nican2018/rvlm。

关键词

引用

@article{arxiv.2603.24224,
  title  = {RVLM: Recursive Vision-Language Models with Adaptive Depth},
  author = {Nicanor Mayumu and Zeenath Khan and Melodena Stephens and Patrick Mukala and Farhad Oroumchian},
  journal= {arXiv preprint arXiv:2603.24224},
  year   = {2026}
}