强化学习可用性与泛化研究议程
人工智能
2025-08-12 v2 机器学习
摘要
在强化学习 (RL) 研究中,常见的做法是在由工程师直接实现的仿真器中进行训练和部署,通常这些仿真器是使用通用编程语言或诸如 CUDA 或 JAX 等硬件加速框架实现的。这意味着开发 RL 算法需要编程和工程专业知识,而使用已开发算法解决新问题也需要相同的专业知识。后者在可用性方面构成了问题,特别是对于缺乏大量工程专业知识的个人和小型组织而言。我们还认为这也是 RL 有效泛化的挑战,因为目前没有一种标准的、共享的形式来表示不同问题。由于我们通常没有一致的表示来向智能体提供有关任何新问题的信息,我们的智能体也无法即时或快速地对新问题进行泛化。在本位论中,我们倡导围绕使用面向用户的描述语言来描述问题的研究议程,以便 (i) 用户即使没有或几乎没有工程专业知识,也能正式描述他们希望由 RL 算法解决的问题,以及 (ii) 算法能够利用问题描述在所有可用描述语言中进行有效泛化。
引用
@article{arxiv.2412.16970,
title = {A Research Agenda for Usability and Generalisation in Reinforcement Learning},
author = {Dennis J. N. J. Soemers and Spyridon Samothrakis and Kurt Driessens and Mark H. M. Winands},
journal= {arXiv preprint arXiv:2412.16970},
year = {2025}
}
备注
To appear in Revised Selected Papers for ICAART 2025. Extended version of ICAART 2025 publication