Rule-VLN:通过语义推理和几何校正桥接感知与合规性
人工智能
2026-04-21 v1 计算机视觉与模式识别
机器人学
摘要
作为具身 AI 向现实世界部署转变,Vision-and-Language Navigation(VLN)任务的成功趋势正从单纯的可达性演变为社会合规性。然而,当前智能体 suffer 从“目标驱动陷阱”中,优先考虑物理几何("我能去吗?")而非语义规则("我可以去吗?"),经常忽略细微的监管约束。为填补这一差距,我们建立了 Rule-VLN,这是首个大规模城市基准测试,用于规则合规导航。它涵盖 29k 节点的庞大环境,注入 177 种多样化的监管类别于 8k 个受约束节点跨越四个课程水平,挑战智能体应对细粒度视觉和行为约束。我们进一步提出了语义导航校正模块(SNRM),一个通用、零样本模块,旨InList 让预训练的智能体具备安全意识。SNRM 将粗到细的视觉感知 VLM 框架与动态绕行规划的认知式心智地图相结合。实验表明,尽管 Rule-VLN 挑战了最先进的模型,SNRM 显著恢复了导航能力,将 CVR 降低 19.26%,并提升 TC 5.97%。
引用
@article{arxiv.2604.16993,
title = {Rule-VLN: Bridging Perception and Compliance via Semantic Reasoning and Geometric Rectification},
author = {Jiawen Wen and Penglei Sun and Wenjie Zhang and Suixuan Qiu and Weisheng Xu and Xiaofei Yang and Xiaowen Chu},
journal= {arXiv preprint arXiv:2604.16993},
year = {2026}
}