中文

洞穴寓言:基于测量的视觉-语言学习

人工智能 2026-05-13 v1 计算与语言 计算机视觉与模式识别

摘要

视觉-语言模型通常在 ISP 处理后的 RGB 图像上进行推理,尽管 RGB 渲染可能会在推理前裁剪、抑制或量化传感器证据。我们研究了当视觉接口更接近底层相机测量时,基础能力是否会得到改善。我们形式化了基于测量的视觉-语言学习,并将其实例化为 PRISM-VL,该方法结合了 RAW 衍生的 Meas.-XYZ 输入、相机条件化的基础以及曝光包围监督聚合,用于将监督从 RGB 代理迁移到测量域观测。使用一个经过质量控制的 15 万条指令微调集和一个针对低光、HDR、可见性敏感和幻觉敏感情况的留出基准,PRISM-VL-8B 达到了 0.6120 BLEU、0.4571 ROUGE-L 和 82.66% 的 LLM-Judge 准确率,相比 RGB 的 Qwen3-VL-8B 基线,分别提升了 +0.1074 BLEU、+0.1071 ROUGE-L 和 +4.46 个百分点。这些结果表明,部分 VLM 基础误差源于 RGB 渲染过程中丢失的信息,而保留测量域证据可以改善多模态推理。

关键词

引用

@article{arxiv.2605.11727,
  title  = {Allegory of the Cave: Measurement-Grounded Vision-Language Learning},
  author = {Kepeng Xu and Li Xu and Gang He and Wenxin Yu},
  journal= {arXiv preprint arXiv:2605.11727},
  year   = {2026}
}