PolarVLM:搭建视觉语言模型中的语义-物理鸿沟
计算机视觉与模式识别
2026-05-12 v2
摘要
主流视觉语言模型(VLM)因标准RGB输入的内在局限性,在处理严重的光学歧义问题(如反射和透明物体)时表现不佳。虽然偏振成像捕获能解决这些歧义的偏振物理参数,但现有方法受限于固定格式的输出,且与开放式推理 remain 孤立。为搭建语义-物理鸿沟,我们引入PolarVLM——首个集成偏振物理参数到视觉语言模型中的多模态框架。通过采用双流架构和渐进式两阶段训练策略,PolarVLM有效防止物理误解释,同时保持通用视觉能力。此外,我们构建了PolarVQA——首个针对偏振感知VQA的基准数据集,包含7.5万组针对反射和透明场景的物理 grounding instruction-tuning 对。实验表明,PolarVLM在五个评估任务中整体超越RGB基线25.4%,在反射识别中提升26.6%,在玻璃计数中提升34.0%,成功实现了 physics-aware 语义理解。
引用
@article{arxiv.2605.07574,
title = {PolarVLM: Bridging the Semantic-Physical Gap in Vision-Language Models},
author = {Yuliang Li and Chu Zhou and Heng Guo and Boxin Shi and Imari Sato and Zhanyu Ma},
journal= {arXiv preprint arXiv:2605.07574},
year = {2026}
}
备注
23 pages, 12 figures, including appendices