基于强化学习的动态算法配置中的奖励设计重要性:以 OneMax 和 (1+(\lambda,\lambda))-GA 为例
机器学习
2025-07-10 v2 神经与进化计算
摘要
动态算法配置(Dynamic Algorithm Configuration, DAC)近年来因机器学习和深度学习算法的普及而受到广泛关注。许多研究利用强化学习(Reinforcement Learning, RL)在决策鲁棒性方面的优势,以解决算法配置相关的优化挑战。然而,正确设计奖励函数以使 RL 代理正常工作并非易事,这需要基于领域专业知识的大量手工设计。在本工作中,我们通过以 OneMax 为例研究控制 (1+(\lambda,\lambda))-GA 种群规模的 DAC 中的奖励设计重要性。我们观察到, poorly designed 的奖励会因缺乏探索而阻碍 RL 代理学习最优策略,从而导致可扩展性和学习发散问题。为此,我们提出应用奖励塑形机制,以促进 RL 代理对环境进行更充分的探索。我们的工作不仅展示了 RL 在动态配置 (1+(\lambda,\lambda))-GA 方面的潜力,还确认了奖励塑形在 RL 代理在 various OneMax 问题规模上的可扩展性方面的优势。
引用
@article{arxiv.2502.20265,
title = {On the Importance of Reward Design in Reinforcement Learning-based Dynamic Algorithm Configuration: A Case Study on OneMax with (1+($\lambda$,$\lambda$))-GA},
author = {Tai Nguyen and Phong Le and André Biedenkapp and Carola Doerr and Nguyen Dang},
journal= {arXiv preprint arXiv:2502.20265},
year = {2025}
}