DOPL:面向偏好反馈的直接在线偏好学习算法
机器学习
2025-07-18 v2 最优化与控制
机器学习
摘要
休闲多臂赌博机(RMAB)广泛应用于受限的序列决策问题建模中,其中每个休闲臂的状态根据马尔可夫链演化,每个状态转移生成标量奖励。然而,RMAB的成功关键在于奖励信号的可用性和质量。不幸的是,在实际中指定精确的奖励函数往往具有挑战性甚至不可行。本文引入了Pref-RMAB模型,考虑存在偏好信号的情况下,决策者仅在每个决策时刻从激活的臂处观察两两偏好反馈,而非来自激活臂的标量奖励。尽管偏好反馈包含的信息不如标量奖励,导致Pref-RMAB似乎更难。为解决此挑战,本文提出了一种直接在线偏好学习(DOPL)算法,用于Pref-RMAB,高效探索未知环境,适应性地以在线方式收集偏好数据,直接利用偏好反馈进行决策。我们证明了DOPL可实现亚线性报酬。据我们所知,这是首个确保报酬的RMAB算法。实验结果进一步表明DOPL的有效性。
引用
@article{arxiv.2410.05527,
title = {DOPL: Direct Online Preference Learning for Restless Bandits with Preference Feedback},
author = {Guojun Xiong and Ujwal Dinesha and Debajoy Mukherjee and Jian Li and Srinivas Shakkottai},
journal= {arXiv preprint arXiv:2410.05527},
year = {2025}
}
备注
ICLR 2025