Symphony:一种用于人形机器人中的归一化校准优势演员与评论家的启发式算法
机器人学
2026-03-03 v8 神经与进化计算
摘要
在我们的工作中我们隐含地认为,认为人类学习得很快是一个误解。学习过程需要时间。婴儿从受限的子宫流体环境开始学习运动。儿童常常受限于身体发育不成熟。即使是成年人也不能立即参与复杂的竞赛。然而,对于机器人,从零开始学习时,我们常常没有等待数百万步的特权。“Swaddling” 规则化负责限制代理在快速但不稳定发展中的行为,以特定方式惩罚动作强度而不直接影响动作。Symphony、过渡性-确定性演员与评论家算法,是一种结合不同想法的简洁方法,旨在实现从零开始训练人形机器人的 Sample Efficiency、Sample Proximity 和动作安全性。众所周知,持续增加高斯噪声而没有适当的平滑处理对电机和齿轮箱有害。与随机算法相比,我们设置有限参数噪声,促进动作强度的减少,安全地增加熵,因为动作浸入较弱噪声中。当动作需要更极端的值时,动作超过弱噪声。训练在实证上对环境和机器人机制都更安全。我们使用 Fading Replay Buffer:使用包含双曲正切的固定公式,我们调整批次抽样概率:记忆包含近期记忆和长期记忆轨迹。Fading Replay Buffer 允许我们在改进当前评论家网络预测相对于指数移动平均时使用 Temporal Advantage。Temporal Advantage 允许我们一次性更新演员和评论家,同时将演员和评论家合并为一个对象并在一行中实现它们的损失。
引用
@article{arxiv.2512.10477,
title = {Symphony: A Heuristic Normalized Calibrated Advantage Actor and Critic Algorithm in application for Humanoid Robots},
author = {Timur Ishuov and Michele Folgheraiter and Madi Nurmanov and Goncalo Gordo and Richárd Farkas and József Dombi},
journal= {arXiv preprint arXiv:2512.10477},
year = {2026}
}
备注
https://github.com/SuspensionRailway/symphony