利用强化学习探究反馈在技能习得中的作用
人工智能
2025-12-10 v1 机器学习
机器人学
系统与控制
系统与控制
摘要
许多高性能的人类活动在很少或没有外部反馈的情况下执行:想想花样滑冰运动员完成三周跳、投手投出好球曲线球、或咖啡师拉出拿铁艺术。为了在完全受控的条件下研究技能习得过程,我们绕过了人类受试者。相反,我们直接将一个通用强化学习智能体与桌面循环水槽中的旋转圆柱体对接,以最大化或最小化阻力。该设置具有几个理想的特性。首先,它是一个物理系统,具有只有物理世界才有的丰富相互作用和复杂动力学:流动高度混沌,极其难以(甚至不可能)精确建模或模拟。其次,目标——阻力最小化或最大化——易于表述,可以直接捕获到奖励中,但好的策略事先并不明显。第三,数十年的实验研究为简单、高性能的开环策略提供了配方。最后,该设置成本低廉,且比人类研究更容易复现。在我们的实验中,我们发现高维流场反馈使智能体仅通过几分钟的真实世界交互就能发现高性能的阻力控制策略。当我们稍后在没有反馈的情况下重放相同的动作序列时,我们获得了几乎相同的性能。这表明反馈,特别是流场反馈,并非执行所学策略所必需。令人惊讶的是,在训练过程中没有流场反馈时,智能体在阻力最大化任务中未能发现任何表现良好的策略,但在阻力最小化任务中仍然成功,尽管速度更慢且可靠性更低。我们的研究表明,学习一项高性能技能可能需要比执行它更丰富的信息,而学习条件的好坏可能仅取决于目标,而非动力学或策略的复杂性。
引用
@article{arxiv.2512.08463,
title = {Using reinforcement learning to probe the role of feedback in skill acquisition},
author = {Antonio Terpin and Raffaello D'Andrea},
journal= {arXiv preprint arXiv:2512.08463},
year = {2025}
}
备注
Website: https://antonioterpin.com/fluids-control