中文

用于构建最优行为基的选项键盘

机器学习 2025-11-14 v2 人工智能

摘要

多任务强化学习旨在以最小或无需额外与环境交互的方式快速识别新任务的解决方案。广义策略改进 (GPI) 通过组合一组基策略来产生新的策略,使其至少不逊于任何单个基策略——尽管不一定最优。在线性奖励情形下,可通过计算凸覆盖集 (CCS) 的技术来确保最优性,但这些方法计算代价高昂,难以扩展到复杂域。选项键盘 (OK) 改进了GPI,通过学习的元策略动态组合基策略,产生至少不逊于且常常更优的策略。但其性能严重依赖于基策略的选择。这引出一个关键问题:是否存在一种最优的基策略集合——即最优行为基——能够在零样本情况下识别任何线性任务的最优解?我们通过引入一种新方法高效构建此类最优行为基,解决了这一开放问题。我们表明,该方法显著减少了为确保新任务最优性所需的基策略数量。我们还证明,它严格比CCS更具表达力,能够以最优方式解决特定类别的非线性任务。我们在具有挑战性的域中进行经验评估,表明其性能优于现有SOTA方法,随任务复杂度的增加,优势也随之提升。

关键词

引用

@article{arxiv.2505.00787,
  title  = {Constructing an Optimal Behavior Basis for the Option Keyboard},
  author = {Lucas N. Alegre and Ana L. C. Bazzan and André Barreto and Bruno C. da Silva},
  journal= {arXiv preprint arXiv:2505.00787},
  year   = {2025}
}

备注

To appear in the Proceedings of the Thirty-ninth Conference on Neural Information Processing Systems (NeurIPS), 2025