中文

代理驱动的自主强化学习研究:四足动物 locomotion 的迭代策略改进

机器人学 2026-03-31 v1 人工智能

摘要

本文记录了代理驱动的自主强化学习研究案例,聚焦于四足动物 locomotion。该设置并非完全自启动的研究系统。人类通过代理式编码环境提供高层指令,而代理人负责执行大部分执行循环:读取代码、诊断故障、编辑奖励与地形配置、启动与监控作业、分析中间指标、提出下一波实验的方案。超过 70 项实验组织在十四波中,代理人从早期粗糙地形运行(平均奖励约 7)开始,最终达到最佳记录的第 12 波实验 exp063(速度误差 0.263,2000 次迭代中 97% 超时),独立在不同 GPU 上复现五次。在档案中还记录了若干具体的自主研究决策:将 PhysX 死锁局限于包含箱体和阶梯状原始构件的数据集、从公开参考实现 \cite{deeprobotics, rlsar} 移植四个奖励项、纠正 Isaac Sim 导入与启动问题、减少诊断用的环境数量、终止挂起的运行、以及在反复遇到 terrain=0.0 结果后将注意力从 HIM 转向其他方向。相较于 AutoResearch 范式 \cite{autoresearch},本案例研究 operates 在更易发生故障的机器人 RL 场景中,涉及多 GPU 实验管理和仿真器特定的工程约束。该工作的贡献是实证性的和纪实性的:它展示了代理人在该领域能够以有限的人类干预方式执行迭代 RL 研究循环,同时也明确指出了人类指导仍在塑造研究议程的地方。

关键词

引用

@article{arxiv.2603.27416,
  title  = {Agent-Driven Autonomous Reinforcement Learning Research: Iterative Policy Improvement for Quadruped Locomotion},
  author = {Nimesh Khandelwal and Shakti S. Gupta},
  journal= {arXiv preprint arXiv:2603.27416},
  year   = {2026}
}