DetectiumFire:面向火灾理解的视觉-语言桥接的综合多模态数据集
计算机视觉与模式识别
2025-11-05 v1 计算与语言
摘要
近期多模态模型在图像生成和推理等任务中展现出强大的性能。然而,在火灾领域应用这些模型仍面临数据标注质量高的公开数据集缺乏的挑战。为填补这一空白,我们介绍了 DetectiumFire,这是一个大规模多模态数据集,包含 2.25 万张高分辨率火灾相关图像和 2500 份真实场景火灾视频,涵盖广泛的火灾类型、环境和风险等级。数据标注包括传统计算机视觉标签(如边界框)以及详细描述场景的文本提示,支持合成数据生成和火灾风险推理等应用。相较于现有基准,DetectiumFire 在规模、多样性和数据质量方面具有显著优势,显著减少冗余并提升真实场景覆盖。我们在目标检测、基于扩散模型的图像生成和视觉-语言推理等多个任务中验证了 DetectiumFire 的实用性。我们的结果表明,这一数据集有潜力推动火灾相关研究的进展,并支持智能安全系统的开发。我们发布 DetectiumFire,以推动 AI 社区更广泛的火灾理解探索。数据集可在 https://kaggle.com/datasets/38b79c344bdfc55d1eed3d22fbaa9c31fad45e27edbbe9e3c529d6e5c4f93890 提供。
引用
@article{arxiv.2511.02495,
title = {DetectiumFire: A Comprehensive Multi-modal Dataset Bridging Vision and Language for Fire Understanding},
author = {Zixuan Liu and Siavash H. Khajavi and Guangkai Jiang},
journal= {arXiv preprint arXiv:2511.02495},
year = {2025}
}
备注
Advances in Neural Information Processing Systems 2025 (NeurIPS 2025), Poster, https://neurips.cc/virtual/2025/loc/san-diego/poster/121400