加权计数赌博机:通过重复暴露最优性克服难解性
机器学习
2023-05-05 v1 人工智能
机器学习
摘要
在在线学习的推荐系统或众包应用中,人类的偏好或能力常常是算法近期动作的函数。受此启发,已有大量工作形式化了如下场景:一个动作的损失是其在前 个时间步内被播放次数的函数,其中 对应人类记忆容量的上界。为更真实地刻画人类记忆随时间的衰减,我们引入了加权计数赌博机(Weighted Tallying Bandit, WTB),它通过要求一个动作的损失是其在最近 个时间步内被播放次数的\emph{加权}求和的函数,推广了上述设定。该 WTB 设定在无进一步假设下是难解的。因此我们基于重复暴露最优性(Repeated Exposure Optimality, REO)研究它,该条件受人类生理学文献启发,要求存在一个动作,当其被重复播放时最终将产生比其他任何动作序列更小的损失。我们研究在 REO 下 WTB 中的完全策略后悔(complete policy regret, CPR)最小化,这是最强的后悔概念。由于 通常未知,我们假设仅能获取 的上界 。我们证明对于具有 个动作和时域 的问题,连续消除算法的一个简单修改具有 的 CPR。有趣的是,在 的可加(而非可乘)因子范围内,这恢复了针对具有传统后悔的更简单随机多臂赌博机的经典保证。我们进一步表明,在我们的设定中,任何算法都将承受 的可加 CPR,表明我们的结果近乎最优。我们的算法计算高效,并通过实验证明了其实用性及对自然基线的优越性。
引用
@article{arxiv.2305.02955,
title = {Weighted Tallying Bandits: Overcoming Intractability via Repeated Exposure Optimality},
author = {Dhruv Malik and Conor Igoe and Yuanzhi Li and Aarti Singh},
journal= {arXiv preprint arXiv:2305.02955},
year = {2023}
}
备注
ICML 2023