中文

Self-CriTeach: LLM 自教与自批评以提升机器人规划——基于自动域生成

机器人学 2026-05-14 v3

摘要

大型语言模型(LLM)在机器人任务规划中展现出巨大潜力,尤其是通过自动生成符号规划域。然而,既有工作主要将生成的域视为规划工具。此类管道在 imperfect logical 状态与感知噪声下仍脆弱,同时忽视了生成域作为可扩展推理监督和结构奖励信号的潜能。与此同时,依赖 chain-of-thought(CoT) supervision 的 LLM 推理,因机器人任务难以收集昂贵的 CoT;强化学习也面临奖励工程的挑战。我们提出 Self-CriTeach,一种 LLM 自教与自批评框架,其中 LLM 自主生成符号规划域,服从双重角色:(1) 在自教阶段,生成的域用于产生大规模机器人规划问题-解对,自动转换为扩展 CoT 轨迹用于监督微调。(2) 在自批评阶段,相同域被重用为结构奖励函数,为强化学习提供稠密反馈,无需手动奖励工程。这种统一的训练管道产出规划增强型 LLM,实现更高的规划成功率、更强的跨任务泛化、更低的推理成本以及对 imperfect logical 状态的更好抵抗力。GitHub 页面: https://markli1hoshipu.github.io/Plan_LLM/

关键词

引用

@article{arxiv.2509.21543,
  title  = {Self-CriTeach: LLM Self-Teaching and Self-Critiquing for Improving Robotic Planning via Automated Domain Generation},
  author = {Jinbang Huang and Zhiyuan Li and Yuanzhao Hu and Zhanguang Zhang and Mark Coates and Xingyue Quan and Yingxue Zhang},
  journal= {arXiv preprint arXiv:2509.21543},
  year   = {2026}
}

备注

International Conference on Machine Learning (ICML) 2026