面向航天器控制的自主推理:基于群相对策略优化的大语言模型框架
机器人学
2026-01-09 v1 最优化与控制
摘要
本文提出一种基于学习的导控-控制方法,将具有推理能力的大语言模型 (LLM) 与群相对策略优化 (GRPO) 结合。该方法包括两个阶段:首先使用监督微调 (SFT) 学习格式化和控制基本块,然后使用 GRPO 进行交互驱动的策略改进,为每个环境训练控制器。该框架在四个控制问题上进行演示,这些问题涵盖了从标准线性系统到非线性振荡动力学,再到三维航天器姿态控制,其中包含轮渡耦合和推力约束。结果表明,经过 GRPO 优化的 LLM 能够在一致的训练设置下综合线性和非线性系统中的可行稳定策略。两种训练方法论使模型能够生成控制序列,同时提供人类可读的决策过程解释。本工作为将 GRPO 基于推理的应用扩展到自主控制系统奠定了基础,潜在可用于航天航行和其他安全关键领域。
引用
@article{arxiv.2601.04334,
title = {Autonomous Reasoning for Spacecraft Control: A Large Language Model Framework with Group Relative Policy Optimization},
author = {Amit Jain and Richard Linares},
journal= {arXiv preprint arXiv:2601.04334},
year = {2026}
}