中文

类脑逆向学习用于规划与控制

人工智能 2026-05-27 v2

摘要

我们提出了一种用于具身规划与控制的类脑框架。基于使哺乳动物大脑实现快速高效目标导向行为的三个原则——成对的前向/逆向内部模型、开环多步运动命令以及动作的顺序、层次化组织——我们的Inverter框架使用通过逆向学习(IL)训练的组件, supplemented where natural by analytic 或 algorithmic 模块;我们对IL进行形式化建模,并将其划分于监督学习、强化学习和模仿学习之间。IL桥接了强化学习(RL)风格的 amortization——单次前向传播但仅输出一个动作——与最优控制(OC)风格的全轨迹序列规划,但采用迭代测试时计算。单个Invert器或层次化n=2 Invert器堆叠在所有3个maze2d和6个antmaze D4RL变体中平均提升24.2%(范围-1.9%至+78.2%),仅为当前方法推理计算量的一到两个数量级。独特地,通过对整个T步动作序列而非逐步优化前向模型(FoM),Invert器能够产生平滑、目标一致的整体轨迹结构,并接近于训练数据本身所对应的控制策略。我们还识别了IL的一个失效模式:在窄化训练数据覆盖范围下的FoM作弊,我们通过使用覆盖更广的随机训练数据来缓解此问题。作为应用示例,Pulse Inverter能够以与标准迭代数值基准(GRAPE)相当的保真度合成任意单个量子门,计算量降低超过1000倍。总之,我们得出结论,IL实现了一种通用的世界界面,尤其适用于延迟和资源受限的具身AI场景。

关键词

引用

@article{arxiv.2605.24152,
  title  = {Neuro-Inspired Inverse Learning for Planning and Control},
  author = {Maryna Kapitonova and Tonio Ball},
  journal= {arXiv preprint arXiv:2605.24152},
  year   = {2026}
}

备注

Version 2, minor fix in online version of the abstract, pdf unchanged