语义-度量贝叶斯风险场:基于VLM先验从人类视频中学习机器人安全
机器人学
2025-12-10 v1
摘要
人类对安全的理解并非二元信号,而是连续的、依赖情境和空间的风险感知概念。尽管风险是主观的,人类会形成合理的心理模型以指导其在动态环境中的行动选择。本工作提出了一种从安全的人类演示视频中提取隐式人类风险模型的框架,引入一种新颖的、语义条件化和空间可变的风险参数化方法。该方法直接受监督于人类安全演示和VLM常识。值得注意的是,我们通过贝叶斯公式来定义风险。该先验由预训练的视觉语言模型提供。在鼓励风险估计更贴近人类认知的同时,似然函数调制先验,以产生一种相对的风险度量。具体而言,似然函数是一个学习的ViT网络,将预训练特征映射到像素级风险值。我们的管道输入RGB图像和查询对象字符串,输出像素稠密的风险图像。这些图像可用于机器人规划任务中的价值预测,或投影到3D空间以用于传统轨迹优化,以产生类似人类的运动。这种学习到的映射使我们能够对新颖的对象和情境进行泛化,并有潜力扩展到更大规模的训练数据集。特别是,引入的贝叶斯框架使我们能够快速适应额外的观察或常识规则。我们展示了我们的方法产生的情境化风险与人类偏好一致。此外,我们说明了该模型的多个下游应用;作为视觉运动规划器的价值学习器,或与经典轨迹优化算法结合使用。我们的结果表明,我们的框架是实现自动化系统内化人类风险感知的重要一步。代码和结果可在https://riskbayesian.github.io/bayesian_risk/查阅。
引用
@article{arxiv.2512.08233,
title = {Semantic-Metric Bayesian Risk Fields: Learning Robot Safety from Human Videos with a VLM Prior},
author = {Timothy Chen and Marcus Dominguez-Kuhne and Aiden Swann and Xu Liu and Mac Schwager},
journal= {arXiv preprint arXiv:2512.08233},
year = {2025}
}