揭示 MLLMs 中功能感知差距:基于 PET-Bench 的原子级视觉对齐与分层评估
计算机视觉与模式识别
2026-01-16 v2
摘要
虽然多模态大语言模型(MLLMs)在症状检测和解剖模态报告生成等任务中已展现出卓越的能力,但其在功能成像领域的能力仍鲜有探索。本文识别并量化了一种根本性的功能感知差距:当前视觉编码器无法独立于形态学先验条件解码功能性示踪剂的生物分布。鉴于正电子断层扫描(PET)是检验这一断裂的典型模态,我们引入 PET-Bench,第一个大型功能成像基准数据集,包含来自 9,732 例多中心、多示踪剂 PET 研究的 52,308 对分层问答对。对 19 个最先进 MLLMs 进行广泛评估,发现一种临界安全风险,称为链式思维(CoT)幻觉陷阱。我们观察到,标准 CoT 提示虽被广泛认为可增强推理,却在 PET 中实现了语言生成与视觉证据之间的脱节,产生临床上流畅但事实不符的诊断。为解决此问题,我们提出原子级视觉对齐(AVA),一种简单微调策略,强制在高级诊断推理之前掌握低级功能感知。我们的结果表明,AVA 有效弥合了感知差距,将 CoT 从幻觉来源转化为稳健的推理工具,并将诊断准确性提升最高可达14.83%。代码和数据已公开于 https://github.com/yezanting/PET-Bench。
引用
@article{arxiv.2601.02737,
title = {Unveiling and Bridging the Functional Perception Gap in MLLMs: Atomic Visual Alignment and Hierarchical Evaluation via PET-Bench},
author = {Zanting Ye and Xiaolong Niu and Xuanbin Wu and Xu Han and Shengyuan Liu and Jing Hao and Zhihao Peng and Hao Sun and Jieqin Lv and Fanghu Wang and Yanchao Huang and Hubing Wu and Yixuan Yuan and Habib Zaidi and Arman Rahmim and Yefeng Zheng and Lijun Lu},
journal= {arXiv preprint arXiv:2601.02737},
year = {2026}
}
备注
9 pages, 6 figures, 6 tables