HomeSafeBench:面向自由探索式家庭安全检查的具身视觉语言模型基准
计算机视觉与模式识别
2025-09-30 v1 计算与语言
摘要
具身智能体可以识别并报告家庭环境中的安全隐患。准确评估其在家庭安全检查任务中的能力至关重要,但现有基准存在两个关键局限:首先,他们通过环境的文本描述而非直接视觉信息来简化安全检查任务,这限制了基于视觉语言模型(VLM)的具身智能体进行准确评估;其次,他们仅使用单一静态视角进行环境观察,这限制了智能体的自由探索,导致遗漏某些被遮挡的安全隐患。为缓解这些问题,我们提出HomeSafeBench,包含12,900个数据点,覆盖五类常见家庭安全隐患:火灾、触电、坠物、绊倒及儿童安全。HomeSafeBench提供来自模拟家庭环境的动态第一人称视角图像,使能够评估VLM在家庭安全检查方面的能力。通过允许具身智能体自由探索房间,HomeSafeBench在复杂环境中提供多个动态视角,实现更全面的检查。我们对主流VLM在HomeSafeBench上的全面评估显示,尽管最佳模型的F1分数仅为10.23%,表明当前VLM在识别安全隐患和选择有效探索策略方面存在显著局限。我们希望HomeSafeBench为未来相关研究提供有价值的参考与支持。该数据集和代码将很快公开。
引用
@article{arxiv.2509.23690,
title = {HomeSafeBench: A Benchmark for Embodied Vision-Language Models in Free-Exploration Home Safety Inspection},
author = {Siyuan Gao and Jiashu Yao and Haoyu Wen and Yuhang Guo and Zeming Liu and Heyan Huang},
journal= {arXiv preprint arXiv:2509.23690},
year = {2025}
}