中文

用于组合动作的强化学习与耦合无空闲多臂老虎机问题

机器学习 2025-03-19 v2 人工智能

摘要

强化学习(RL)越来越多地被应用于解决实际的规划问题,已在处理大规模状态空间和时间范围方面取得进展。然而,在许多领域,RL 方法面临的关键瓶颈是无法容纳大规模、组合结构的动作空间。在此类情境下,即使在单个时间步骤中表示可行动作集合,也可能需要复杂的离散优化 formulation。我们利用最近在将训练好的神经网络嵌入优化问题方面的进展,提出了 SEQUOIA,一种直接针对可行动作空间优化长期奖励的 RL 算法。我们的方法将 Q 网络嵌入混合整数规划,以在每个时间步骤选择组合动作。我们聚焦于对无空闲多臂老虎机的规划,这类规划问题捕捉了许多实际的序列决策示例。我们引入 coRMAB,即一类具有组合动作的更广泛的无空闲多臂老虎机,组合动作无法跨多臂解耦,需要直接求解联合的指数级动作空间。我们在四个具有组合约束的新型无空闲老虎机问题上对 SEQUOIA 进行了实证验证:包括多重干预、路径约束、二分图匹配和容量约束。我们的方法在这些困难实例上显著优于现有方法——这些方法无法同时处理序列规划和组合选择——平均提高了 24.8%。

关键词

引用

@article{arxiv.2503.01919,
  title  = {Reinforcement learning with combinatorial actions for coupled restless bandits},
  author = {Lily Xu and Bryan Wilder and Elias B. Khalil and Milind Tambe},
  journal= {arXiv preprint arXiv:2503.01919},
  year   = {2025}
}

备注

To appear at ICLR 2025. Code at https://github.com/lily-x/combinatorial-rmab