VLM-DEWM:面向可验证性与鲁棒性的视觉语言制造计划中的动态外部世界模型
机器人学
2026-02-18 v1 人工智能
摘要
视觉语言模型 (VLM) 在智能制造中显示出高级规划的潜力,但在动态工作单元的部署面临两个关键挑战:(1) 无状态运行,无法持久跟踪超出视图的状态,导致世界状态漂移;(2) 推理不透明,故障难以诊断,导致代价高昂的盲目重试。本文提出 VLM-DEWM,一种将 VLM 推理与世界状态管理解耦的认知架构,通过持久且可查询的动态外部世界模型 (DEWM) 实现。每个 VLM 决策被结构化为外部可推理痕迹 (ERT),包括动作提议、世界信念和因果假设,该信踪在执行前validated against DEWM。当发生故障时,预测状态与观察状态之间的差异分析可实现针对性恢复,而无需全局重新规划。我们在多站点装配、大型设施探索和诱导故障下的真实机器人恢复中评估了 VLM-DEWM。与基准记忆增强 VLM 系统相比,VLM DEWM 将状态跟踪准确率提高从 56% 提升到 93%,恢复成功率从低于 5% 提升到 95%,通过结构化记忆显著降低计算开销。这些结果将 VLM-DEWM 确立为动态制造环境中长期机器人操作的可验证且鲁棒的解决方案。
引用
@article{arxiv.2602.15549,
title = {VLM-DEWM: Dynamic External World Model for Verifiable and Resilient Vision-Language Planning in Manufacturing},
author = {Guoqin Tang and Qingxuan Jia and Gang Chen and Tong Li and Zeyuan Huang and Zihang Lv and Ning Ji},
journal= {arXiv preprint arXiv:2602.15549},
year = {2026}
}