HomeGuard:基于视觉语言模型的具身守护系统用于识别家庭任务中的情境性风险
计算机视觉与模式识别
2026-03-17 v1
摘要
视觉语言模型(VLM)使具身智能体能够执行复杂指令,但仍然容易受到情境性安全风险的威胁,这类风险的危险性源于环境状态的细微变化导致原本无害的命令变得危险。现有的安全措施往往不够充分。基于规则的方法在物体密集的场景中缺乏可扩展性,而依赖提示工程的模型方法则感知过于宽泛,导致风险被漏检或出现幻觉。为此,我们提出一种与体系结构无关的守护系统,采用 Context-Guided Chain-of-Thought(CG-CoT)机制。该机制将风险评估分解为主动感知阶段——依次将注意力锚定于交互目标及其相关空间邻域——随后基于此视觉证据进行语义判断。我们提供了精心策划的 grounding 数据集,并采用基于过程奖励的强化微调(RFT)策略进行两阶段训练,以确保精确的中间 grounding。实验表明,我们的模型 HomeGuard 在安全性方面显著提升,相较于基线模型将风险匹配率提高超过 30%,同时降低了过度安全现象。除危险检测外,生成的视觉锚点还可作为下游规划器的可操作空间约束,促进显式碰撞规避和安全轨迹生成。代码和数据已在 https://github.com/AI45Lab/HomeGuard 上发布。
引用
@article{arxiv.2603.14367,
title = {HomeGuard: VLM-based Embodied Safeguard for Identifying Contextual Risk in Household Task},
author = {Xiaoya Lu and Yijin Zhou and Zeren Chen and Ruocheng Wang and Bingrui Sima and Enshen Zhou and Lu Sheng and Dongrui Liu and Jing Shao},
journal= {arXiv preprint arXiv:2603.14367},
year = {2026}
}