AlphaRank:一种用于排序与选择问题的人工智能方法
机器学习
2024-02-05 v1 统计方法学
摘要
我们介绍了AlphaRank,一种用于解决固定预算排序与选择(R&S)问题的人工智能方法。我们将序贯采样决策形式化为马尔可夫决策过程,并提出了一种基于蒙特卡洛模拟的rollout策略,该策略利用经典R&S程序作为基础策略,以高效学习随机动态规划的价值函数。我们通过使用深度强化学习基于给定先验离线预训练神经网络模型来加速在线样本分配。我们还提出了一种适用于大规模问题的可并行计算框架,有效结合了“分而治之”和“递归”以增强可扩展性和效率。数值实验表明,AlphaRank的性能显著优于基础策略,这归因于AlphaRank在均值、方差和诱导相关性之间权衡的卓越能力,而许多现有策略忽略了这种权衡。
引用
@article{arxiv.2402.00907,
title = {AlphaRank: An Artificial Intelligence Approach for Ranking and Selection Problems},
author = {Ruihan Zhou and L. Jeff Hong and Yijie Peng},
journal= {arXiv preprint arXiv:2402.00907},
year = {2024}
}