SmokeBench:评估多模态大语言模型用于野火烟雾检测
计算机视觉与模式识别
2025-12-15 v1
摘要
野火烟雾透明、无定形,且常与云在视觉上混淆,使得早期阶段检测尤为困难。在这项工作中,我们引入了一个名为SmokeBench的基准,用于评估多模态大语言模型(MLLMs)在图像中识别和定位野火烟雾的能力。该基准包含四项任务:(1)烟雾分类,(2)基于图块的烟雾定位,(3)基于网格的烟雾定位,以及(4)烟雾检测。我们评估了多个MLLMs,包括Idefics2、Qwen2.5-VL、InternVL3、Unified-IO 2、Grounding DINO、GPT-4o和Gemini-2.5 Pro。我们的结果表明,虽然某些模型可以在烟雾覆盖大面积区域时分类其存在,但所有模型在准确定位方面都存在困难,尤其是在早期阶段。进一步分析揭示烟雾体积与模型性能强相关,而对比度所起的作用相对较小。这些发现凸显了当前MLLMs在安全关键型野火监测中的关键局限性,并强调了需要改进早期阶段烟雾定位的方法。
引用
@article{arxiv.2512.11215,
title = {SmokeBench: Evaluating Multimodal Large Language Models for Wildfire Smoke Detection},
author = {Tianye Qi and Weihao Li and Nick Barnes},
journal= {arXiv preprint arXiv:2512.11215},
year = {2025}
}
备注
Accepted to WACV 2026