面向异构预算约束的放松多动作臂 bandit 的神经索引策略
机器学习
2025-10-28 v1 机器学习
摘要
放松多臂 bandit(RMABs)提供了一种在不确定性下进行顺序决策的可扩展框架,但经典形式假设二元动作和单个全局预算。现实场景中,常涉及多个干预手段且成本和约束各异,例如医疗领域,这类假设便不再适用。我们提出一种神经索引策略(Neural Index Policy, NIP),用于异构预算约束下的多动作 RMAB。该方法学习为臂-动作对分配预算感知索引,使用神经网络,并通过 formulated as entropy-regularized optimal transport(OT)问题的可微分背包层将其转换为可行的资源分配。 resulting model 将索引预测和受限优化在单个端到端可微框架中统一,使能够直接基于决策质量进行梯度训练。该网络优化旨在使其诱导的占用度测度与线性规划松弛的理论上界相吻合,桥接了渐近 RMAB 理论与实际学习。经实证研究表明,NIP 在保持严格执行异构预算的同时,以 Oracle 占用度测度策略为基准,实现了接近最优的性能,并扩展到数百个臂的数值规模。这一工作建立了一个通用、理论依据且可扩展的框架,用于在复杂资源受限环境中学习基于索引的策略。
引用
@article{arxiv.2510.22069,
title = {Neural Index Policies for Restless Multi-Action Bandits with Heterogeneous Budgets},
author = {Himadri S. Pandey and Kai Wang and Gian-Gabriel P. Garcia},
journal= {arXiv preprint arXiv:2510.22069},
year = {2025}
}