基于公平性的组合准半带盒问题:无限制反馈延迟情形
机器学习
2024-07-30 v3 机器学习
摘要
我们研究在公平性约束下处理无限制反馈延迟的随机性组合准半带盒问题。这一问题源于众包和在线广告等应用场景,其中反馈无法立即获得,且不同选择(或臂)之间的公平性至关重要。我们考虑两种无限制反馈延迟类型:奖励独立延迟(反馈延迟与奖励独立)和奖励相关延迟(反馈延迟与奖励相关)。此外,我们引入基于绩效的公平性约束,以确保对不同臂位的公平选择。我们定义奖励后悔和公平后悔,并提出新的基于绩效的算法以在无限制反馈延迟下选择臂位。我们证明了所有算法在延迟分布分位数依赖下均实现亚线性期望奖励后悔和期望公平后悔。我们还使用合成数据和真实世界数据进行大量实验,表明算法能够在不同反馈延迟下公平选择臂位。
引用
@article{arxiv.2407.15439,
title = {Merit-based Fair Combinatorial Semi-Bandit with Unrestricted Feedback Delays},
author = {Ziqun Chen and Kechao Cai and Zhuoyue Chen and Jinbei Zhang and John C. S. Lui},
journal= {arXiv preprint arXiv:2407.15439},
year = {2024}
}
备注
28 pages, 9 figures, accepted for 27th European Conference on Artificial Intelligence (ECAI 2024), Source code added, Typo fixed