中文

Robo-Instruct:用于微调代码 LLM 的仿真器增强指令对齐

计算与语言 2025-10-13 v5 人工智能 机器人学

摘要

代码 LLM 在将自然语言任务转换为服务机器人可执行的程序方面显示出了前景。我们关注的是微调针对该目的设计的小型专用 LLM,但为每个机器人收集特定于其任务的程序-对等数据集需要耗时且昂贵。虽然 SELF-INSTRUCT 和 EVOL-INSTRUCT 等方法能够基于少量示例生成新任务,但无法提供符合物理世界和机器人约束、且正确使用所提供编程接口的相应程序。使用仿真器来检查此类约束是一种自然的潜在解决方案,但构建能够处理任意任务及其必需对象和位置的仿真环境具有挑战性。为解决这些挑战,我们引入 ROBO-INSTRUCT,通过在程序执行期间机会性地推断实体属性并强制执行相应约束来合成任务特定的仿真环境。此外,ROBO-INSTRUCT集成了 LLM 辅助的后处理程序,以更好地对齐指令与机器人程序。我们在多个 LLM 上展示了 ROBO-INSTRUCT的有效性,表明我们的微调模型在所有基线方法上均优于,并甚至匹配或超越了几个更大且专有的模型。

关键词

引用

@article{arxiv.2405.20179,
  title  = {Robo-Instruct: Simulator-Augmented Instruction Alignment For Finetuning Code LLMs},
  author = {Zichao Hu and Junyi Jessy Li and Arjun Guha and Joydeep Biswas},
  journal= {arXiv preprint arXiv:2405.20179},
  year   = {2025}
}

备注

Conference on Language Modeling (COLM) 2025, Project site: https://amrl.cs.utexas.edu/robo-instruct/