顺序窄开口规划的几何对齐 LLM 精细调优
机器人学
2026-03-18 v1
摘要
我们研究通过多个顺序窄开口实现刚体运动规划,这需要长期程度的几何推理,因为用于穿越早期开口的配置约束了后续开口可达配置的集合。为实现此目标,我们提出一种几何对齐的大语言模型 (LLM) 精细调优框架,用于生成既几何可行又跨开口协调的固定长度、机器可读路标序列。我们的方法采用双层训练管道。首先,我们对人类演示进行基于失败驱动的 LoRA 监督式精细调优 (SFT),以整合结构化失败反馈教授模型常见的失败模式并强制输出格式。其次,我们使用几何验证的群相对策优化 (GRPO) 对相同的 LoRA 适配器进行细化:每个抽样路标序列通过模型基准规划器稠密化,并使用确定性几何派生奖励评分,以实现连续运动可行性。为验证我们方法的有效性,我们提供了来自仿真的定量和定性结果。我们的方法在分布式和非分布式环境中均实现了最高成功率,并在定性上表现出通过选择促进进入后续开口的退出姿态来实现长期程度的几何推理。
引用
@article{arxiv.2603.16028,
title = {Geometry-Aligned LLM Fine-Tuning for Sequential Narrow-Opening Planning},
author = {Al Jaber Mahmud and Xuan Wang},
journal= {arXiv preprint arXiv:2603.16028},
year = {2026}
}
备注
8 pages, 3 figures