新兴神经自动机政策:从视觉运动轨迹中学习符号结构
机器人学
2026-04-17 v2
摘要
将机器人学习扩展到long-horizon任务仍是一个巨大的挑战。虽然end-to-end政策往往缺乏足以有效进行长期推理的结构先验条件,但传统的神经符号方法又高度依赖手工制作的符号先验条件。为此,我们引入ENAP(Emergent Neural Automaton Policy),一种允许bi-level神经符号政策从视觉运动示范中自适应emergent的框架。具体而言,我们首先采用自适应聚类和L*算法的扩展版,从视觉运动数据中推断出一个Mealy状态机,作为捕获潜在任务模式的可解释的high-level planner。然后,这种离散结构指导一个low-level reactive残差网络通过行为克隆学习精确的连续控制。通过显式建模离散转换和连续残差,ENAP在不需要task-specific标签的情况下实现了高样本效率和可解释性。针对复杂操作和long-horizon任务进行的大量实验表明,ENAP在低数据 regime中比最先进的(SoTA)end-to-end视觉动作学习(VLA)政策提升了最高可达27%,同时提供了机器人意图的结构化表示(图1)。
引用
@article{arxiv.2603.25903,
title = {Emergent Neural Automaton Policies: Learning Symbolic Structure from Visuomotor Trajectories},
author = {Yiyuan Pan and Xusheng Luo and Hanjiang Hu and Peiqi Yu and Changliu Liu},
journal= {arXiv preprint arXiv:2603.25903},
year = {2026}
}