中文

SmokeBench:评估多模态大语言模型用于野火烟雾检测

计算机视觉与模式识别 2025-12-15 v1

摘要

野火烟雾透明、无定形,且常与云在视觉上混淆,使得早期阶段检测尤为困难。在这项工作中,我们引入了一个名为SmokeBench的基准,用于评估多模态大语言模型(MLLMs)在图像中识别和定位野火烟雾的能力。该基准包含四项任务:(1)烟雾分类,(2)基于图块的烟雾定位,(3)基于网格的烟雾定位,以及(4)烟雾检测。我们评估了多个MLLMs,包括Idefics2、Qwen2.5-VL、InternVL3、Unified-IO 2、Grounding DINO、GPT-4o和Gemini-2.5 Pro。我们的结果表明,虽然某些模型可以在烟雾覆盖大面积区域时分类其存在,但所有模型在准确定位方面都存在困难,尤其是在早期阶段。进一步分析揭示烟雾体积与模型性能强相关,而对比度所起的作用相对较小。这些发现凸显了当前MLLMs在安全关键型野火监测中的关键局限性,并强调了需要改进早期阶段烟雾定位的方法。

关键词

引用

@article{arxiv.2512.11215,
  title  = {SmokeBench: Evaluating Multimodal Large Language Models for Wildfire Smoke Detection},
  author = {Tianye Qi and Weihao Li and Nick Barnes},
  journal= {arXiv preprint arXiv:2512.11215},
  year   = {2025}
}

备注

Accepted to WACV 2026