从稀疏到稠密:基于婴儿步伐的奖励转换在目标导向强化学习中的应用
机器学习
2025-01-30 v1 人工智能
机器人学
摘要
强化学习 (RL) 智能体面临在奖励稀疏或稠密的环境中平衡探索与开发的挑战,尤其是在奖励偏向学习的环境中。生物系统,如人类婴儿,天然地通过从稀疏奖励驱动的自由探索过渡到由越来越稠密奖励引导的目标导向行为来 navigate this balance。受此自然进展启发,我们研究基于婴儿步伐的奖励转换在目标导向 RL 任务中的应用。我们的研究聚焦于在保持最优策略的前提下,从稀疏奖励过渡到基于潜在的稠密奖励 (S2D)。通过在动态机器人臂操作和 egocentric 3D 导航任务上的实验,我们证明有效的 S2D 奖励转换显著增强了学习性能和样本效率。此外,我们使用 Cross-Density Visualizer,表明 S2D 转换平滑了策略损失景观,导致更宽的最小值,从而提高 RL 模型的泛化能力。我们还重新诠释了 Tolman 的迷宫实验,强调了 S2D 奖励中早期自由探索学习的关键作用。
引用
@article{arxiv.2501.17842,
title = {From Sparse to Dense: Toddler-inspired Reward Transition in Goal-Oriented Reinforcement Learning},
author = {Junseok Park and Hyeonseo Yang and Min Whoo Lee and Won-Seok Choi and Minsu Lee and Byoung-Tak Zhang},
journal= {arXiv preprint arXiv:2501.17842},
year = {2025}
}
备注
Extended version of AAAI 2024 paper: Unveiling the Significance of Toddler-Inspired Reward Transition in Goal-Oriented Reinforcement Learning. This manuscript is currently being prepared for journal submission