基于偏差抽样和 GPU 加速轨迹优化的可扩展 Actor-Critic 学习:CACTO-BIC
机器人学
2026-02-24 v1 最优化与控制
摘要
轨迹优化 (TO) 和强化学习 (RL) 提供了互补的优势,用于解决最优控制问题。TO 高效计算局部最优解,但在非凸性问题中难以处理;而 RL 对非凸性更鲁棍,但计算成本显著增加。CACTO (Continuous Actor-Critic with Trajectory Optimization) 原本通过学习温暖启动策略,将 TO 求解器引导至低成本轨迹来结合这两者的优势。然而,规模性仍是关键限制,随着系统复杂度增加,TO 的计算成本显著上升。本文引入 CACTO-BIC 以应对这些挑战。CACTO-BIC 通过偏差初始状态抽样提高数据效率,利用局部最优策略相关价值函数特性;此外,通过 GPU 加速降低计算时间。经验评估显示,CACTO-BIC 在样本效率和计算速度上均优于 CACTO。与 PPO 的比较表明,我们的方法在更短时间内可实现相似的解。最后,在外星人 GO 四足机器人上的实验表明,CACTO-BIC 能够扩展到高维系统,适用于实时应用。
引用
@article{arxiv.2602.19699,
title = {CACTO-BIC: Scalable Actor-Critic Learning via Biased Sampling and GPU-Accelerated Trajectory Optimization},
author = {Elisa Alboni and Pietro Noah Crestaz and Elias Fontanari and Andrea Del Prete},
journal= {arXiv preprint arXiv:2602.19699},
year = {2026}
}