探析视觉-语言-动作模型的符号状态及其与认知架构的集成
机器人学
2025-02-10 v1 人工智能
摘要
视觉-语言-动作(Vision-Language-Action, VLA)模型通过将视觉和语言输入转化为机器人动作,有望成为通用机器人解决方案,但由于其黑盒性质和对环境变化的敏感性,缺乏可靠性。相比之下,认知架构(Cognitive Architecture, CA)擅长符号推理和状态监控,但受限于严格的预定义执行。本工作通过探查 OpenVLA 的隐藏层来揭示物体属性、关系和动作状态的符号表征,从而将这两种方法联系起来,实现与 CA 的集成以增强可解释性和鲁棒性。通过在 LIBERO-spatial 抓取与放置任务上的实验,我们分析了 OpenVLA 的 Llama 主干不同层中符号状态的编码。我们的探查结果显示,在大多数层中,物体状态和动作状态均保持了一致的高准确率(> 0.90),尽管与我们的假设相反,我们并未观察到物体状态比动作状态更早编码的预期模式。我们展示了一个集成的 DIARC-OpenVLA 系统,该系统利用这些符号表征进行实时状态监控,为更可解释和更可靠的机器人操作奠定了基础。
引用
@article{arxiv.2502.04558,
title = {Probing a Vision-Language-Action Model for Symbolic States and Integration into a Cognitive Architecture},
author = {Hong Lu and Hengxu Li and Prithviraj Singh Shahani and Stephanie Herbers and Matthias Scheutz},
journal= {arXiv preprint arXiv:2502.04558},
year = {2025}
}
备注
8 Pages, 4 Figures