中文

在设备端计算约束下使用强化学习控制微型机器人

机器人学 2026-01-01 v1 系统与控制 系统与控制

摘要

自主微型机器人的一个重要功能是能够在复杂地形上进行鲁棒运动。本文探索了一种用于微型机器人运动的边缘机器学习 (ML) 方法,允许在计算、内存和功耗约束下实现设备端、更低延迟的控制。本文通过强化学习 (RL) 探索了亚厘米级四足微型机器人的运动,并将得到的控制器部署在一个超小型片上系统 (SoC) SCμ\muM-3C 上,该系统搭载了一个运行频率为 5 MHz 的 ARM Cortex-M0 微控制器。我们在大规模并行 GPU 仿真中训练了一个紧凑的 FP32 多层感知器 (MLP) 策略,该策略具有两个隐藏层 ([128,64][128, 64]),并通过在仿真参数上使用领域随机化来增强鲁棒性。然后,我们研究了整数 (Int8) 量化(逐张量和逐特征),以在资源有限的硬件上实现更高的推理更新速率,并通过一个针对 Cortex-M0 推理的每更新周期数模型,将硬件功耗预算与可实现的更新频率联系起来。我们提出了一种资源感知的步态调度观点:给定一个设备功耗预算,我们可以选择在相应可行的更新频率下最大化期望 RL 奖励的步态模式(小跑/中间/奔跑)。最后,我们在一个真实世界的大型机器人的不平坦地形上部署了我们的 MLP 策略,定性地注意到领域随机化训练可以提高分布外稳定性。我们并未声称本工作实现了真实世界大型机器人的经验零样本迁移。

关键词

引用

@article{arxiv.2512.24740,
  title  = {Control of Microrobots with Reinforcement Learning under On-Device Compute Constraints},
  author = {Yichen Liu and Kesava Viswanadha and Zhongyu Li and Nelson Lojo and Kristofer S. J. Pister},
  journal= {arXiv preprint arXiv:2512.24740},
  year   = {2026}
}

备注

9 pages, 10 figures