DarkQA:面向低光室内场景的视觉-原语问题答案基准
计算机视觉与模式识别
2026-05-13 v4 人工智能
机器学习
机器人学
摘要
视觉语言模型 (VLM) 正日益被用作具身智能体的核心推理模块。现有基准在理想、充足照明的条件下评估其能力,但鲁棒的 24/7 运行需求要求在广泛的视觉退化条件下(包括夜间或黑暗环境中的低光条件)也能发挥作用,这一核心需求长期未被充分关注。为此,我们提出了 DarkQA,一个用于评估具身情境下多级低光条件下感知原语的开源基准。DarkQA 在受控退化程度的单视图第三人称观察中进行评估,孤立低光感知故障,防止其与复杂的具身任务相互 entanglement。基准包含 9.4K 个确定生成且可验证的 question-image 对,涵盖五种视觉原语家族。DarkQA 的关键设计特征是其物理保真性:视觉退化在线性 RAW 空间中建模,模拟物理性的光照下降和传感器噪声,随后采用类似 ISP 的渲染管线;我们进一步将合成方法针对真实的配对低光相机数据进行验证。我们评估了代表性 VLM 和低光图像增强 (LLIE) 预处理方法。结果显示,低照明和传感器噪声会导致 VLM 感知性能一致退化,而 LLIE 提供的恢复在不同程度上有效但不稳定。我们通过评估广泛的 state-of-the-art VLM 和低光图像增强 (LLIE) 模型,系统性地揭示了 VLM 在这些具有挑战性视觉条件下的局限性。我们的代码和基准数据集将在接受后公开。项目网址: https://darkqa-benchmark.github.io
引用
@article{arxiv.2512.24985,
title = {DarkQA: Benchmarking Vision-Language Models on Visual-Primitive Question Answering in Low-Light Indoor Scenes},
author = {Yohan Park and Hyunwoo Ha and Wonjun Jo and Tae-Hyun Oh},
journal= {arXiv preprint arXiv:2512.24985},
year = {2026}
}
备注
This work has been submitted to the IEEE for possible publication