具有全_bandit 反馈及更一般情形的组合纯探索:有限观测下不确定性中的组合优化求解
机器学习
2023-08-30 v2 离散数学
数据结构与算法
社会与信息网络
机器学习
摘要
组合优化是理论计算机科学与运筹学中已被广泛研究的基础研究领域之一。在开发组合优化算法时,通常假设边权等参数作为精确已知的输入。然而,这一假设可能并不成立,因为在推荐系统、众包、通信网络和在线广告等许多应用中,输入参数往往是不确定的或最初未知的。为解决此类不确定性,多臂 bandit 的组合纯探索(CPE)问题及其变体已受到越来越多的关注。早期的 CPE 工作研究了半 bandit 反馈,或假设每条单独边的输出在所有轮次中总是可获取的。然而,由于预算上限或隐私顾虑等实际约束,这种强反馈在近期应用中并不总是可用的。在本文中,我们综述了针对有限反馈组合纯探索问题近期提出的技术。
引用
@article{arxiv.2012.15584,
title = {Combinatorial Pure Exploration with Full-bandit Feedback and Beyond: Solving Combinatorial Optimization under Uncertainty with Limited Observation},
author = {Yuko Kuroki and Junya Honda and Masashi Sugiyama},
journal= {arXiv preprint arXiv:2012.15584},
year = {2023}
}
备注
Preprint of an Invited Review Article, In Fields Institute