HomeSafe-Bench:评估面向嵌入式代理在家庭场景中不安全动作检测的视觉语言模型
计算机视觉与模式识别
2026-03-16 v2 人工智能
密码学与安全
摘要
嵌入式代理的快速发展加速了家用机器人在真实环境中的部署。然而,与结构化工业环境不同,家庭空间引入不可预测的安全风险,其中包括感知延迟和缺乏常识知识,可能导致危险错误。当前的安全评估常常局限于静态图像、文本或通用危险,无法充分衡量这些特定情境下动态不安全动作检测的效果。为弥合这一差距,我们引入 HomeSafe-Bench,这是一个旨在评估视觉语言模型 (VLM) 在家庭场景中不安全动作检测的具挑战性基准测试。HomeSafe-Bench 通过结合物理仿真与先进视频生成技术构建,包含 438 个具有多样性的案例,覆盖六大功能区域,并具备细粒度的多维注释。除基准测试外,我们提出了面向家庭安全的分层双脑护卫 (HD-Guard),这是一种用于实时安全监控的分层流式架构。HD-Guard 协调轻量级 FastBrain 进行持续高频筛查,以及异步大规模 SlowBrain 进行深层多模态推理,有效平衡了推理效率与检测精度。评估表明,HD-Guard 在延迟与性能之间实现了优越的平衡,而我们的分析则识别了当前基于 VLM 的安全检测中的关键瓶颈。
引用
@article{arxiv.2603.11975,
title = {HomeSafe-Bench: Evaluating Vision-Language Models on Unsafe Action Detection for Embodied Agents in Household Scenarios},
author = {Jiayue Pu and Zhongxiang Sun and Zilu Zhang and Xiao Zhang and Jun Xu},
journal= {arXiv preprint arXiv:2603.11975},
year = {2026}
}