中文

从局部纠错到通用技能:通过MEMO改进神经符号策略

机器人学 2026-03-06 v1

摘要

近期研究采用神经符号框架构建通用操作策略。该框架的优势在于:通过应用即插即用的视觉和语言模型,机器人能够将复杂任务分解为语义子任务。然而,根本性瓶颈在于,机器人需要将这些子任务 grounded 到具体的肢体动作。技能可以呈现多种形式(如轨迹片段、运动原语、编码函数),但无论其形式如何,技能都充当了约束条件。高层策略只能通过可用的技能来完成语言推理;如果机器人无法为当前任务生成正确的技能,其策略将失败。我们提出要解决这一限制——并动态扩展机器人的技能——方法是利用用户反馈。当机器人失败时,人类能够直观地解释错误原因(例如,“不,往上走”)。虽然简单的做法是下次机器人遇到类似情境时回溯这些文本,但我们假设通过收集、聚类和重新表述来自多个用户和任务的自然语言纠正,能够合成更通用的文本指导和编码技能模板。基于此假设,我们开发了 Memory Enhanced Manipulation (MEMO)。MEMO构建并维护一个从人类反馈和任务成功中收集的检索增强技能书。在运行时,MEMO检索此技能书中的相关文本和代码,使机器人策略能够生成新技能,同时在多任务人类反馈上进行推理。我们的实验表明,使用MEMO将局部反馈聚合为通用技能模板,使我们能够在现有基线方法受限的新任务上实现泛化。详见补充材料:https://collab.me.vt.edu/memo

关键词

引用

@article{arxiv.2603.04560,
  title  = {From Local Corrections to Generalized Skills: Improving Neuro-Symbolic Policies with MEMO},
  author = {Benjamin A. Christie and Yinlong Dai and Mohammad Bararjanianbahnamiri and Simon Stepputtis and Dylan P. Losey},
  journal= {arXiv preprint arXiv:2603.04560},
  year   = {2026}
}