基于神经符号反向推理的跨域 Demo-to-Code
人工智能
2026-03-20 v1
摘要
近期视觉-语言模型 (VLM) 的进展使视频指令式机器人编程成为可能,允许智能体解释视频演示并生成可执行控制代码。我们将视频指令式机器人编程建模为跨域适应问题,其中演示与部署之间的感知和物理差异导致程序性不匹配。然而,当前 VLM 缺乏所需的程序理解能力,以重新构建因果依赖关系并在此类域迁移下实现任务兼容行为。我们引入 NeSyCR,一种神经符号反向推理框架,使任务程序的可验证适应成为可能,为代码策略的可靠合成提供支持。NeSyCR 将视频演示抽象为捕获底层任务程序的符号轨迹。给定部署观察,它推导出揭示跨域不兼容性的反向状态。通过对符号状态空间进行探索并执行可验证检查,NeSyCR 提出程序性修订以恢复与演示程序的兼容性。NeSyCR 在最强基线 Statler 的基础上实现了 31.14% 的任务成功率提升,显示出在仿真和真实世界操作任务中具备稳健的跨域适应能力。
引用
@article{arxiv.2603.18495,
title = {Cross-Domain Demo-to-Code via Neurosymbolic Counterfactual Reasoning},
author = {Jooyoung Kim and Wonje Choi and Younguk Song and Honguk Woo},
journal= {arXiv preprint arXiv:2603.18495},
year = {2026}
}
备注
Accepted at CVPR 2026