中文

从阴影到光:跨 MPC、DeePC、RL 与 LLM 代理的安全高效策略学习

机器人学 2025-10-07 v1 系统与控制 系统与控制

摘要

现代控制应用(尤其是机器人与车辆运动控制)的主要挑战之一是实现准确、快速且安全的运动。为此,已开发出用于强制安全性同时确保高性能的优化控制策略。由于实际系统的基本原理模型往往可获得,基于模型的控制器广泛使用。模型预测控制(MPC)是一种在显式处理安全约束的同时优化性能的领先方法。然而,获取复杂系统的准确模型较为困难,这就动机了数据驱动方法的出现。基于学习模型的 MPC 利用已学习的模型减少对手工动力学的依赖,而强化学习(RL)可直接从与环境交互的数据中学习近似最优策略。数据驱动预测控制(DeePC)进一步通过直接从原始输入输出数据中学习安全策略来规避建模问题。最近,大语言模型(LLM)代理也涌现,能够将自然语言指令翻译为结构化的控制问题表述。尽管上述方法取得了进展,但数据驱动策略面临显著局限:它们常因响应速度慢、计算需求大、存储需求高而在实际系统中不够实用,这类系统具有快速动力学、受限 onboard 计算资源或严格内存约束。为此,已提出 various 技术,如简化阶模型、函数逼近策略学习和凸优化松弛,以降低计算复杂度。本文提出八种此类方法并在实际应用中展示其有效性,包括机器人机械臂、软体机器人以及车辆运动控制。

关键词

引用

@article{arxiv.2510.04076,
  title  = {From Shadow to Light: Toward Safe and Efficient Policy Learning Across MPC, DeePC, RL, and LLM Agents},
  author = {Amin Vahidi-Moghaddam and Sayed Pedram Haeri Boroujeni and Iman Jebellat and Ehsan Jebellat and Niloufar Mehrabi and Zhaojian Li},
  journal= {arXiv preprint arXiv:2510.04076},
  year   = {2025}
}