论 Epoch-Greedy 在多智能体上下文赌博机机制中的鲁棒性
机器学习
2023-07-18 v1 信息检索
机器学习
摘要
在如按点击付费(PPC)拍卖等多臂赌博机机制中的高效学习通常面临三个挑战:1)诱导真实出价行为(激励),2)在用户中使用个性化(上下文),以及 3)规避点击模式中的操纵(损坏)。这些挑战在文献中已被正交地研究:激励已由一系列真实多臂赌博机机制的工作解决,上下文已由上下文赌博机算法广泛处理,而损坏则由近期关于对抗损坏赌博机的工作讨论。由于这些挑战共存,理解每种方法在应对其他挑战时的鲁棒性、提供能同时处理所有的算法并揭示该组合中的固有局限十分重要。本工作中,我们展示了最著名的上下文赌博机算法 -greedy 可被扩展以处理上下文多臂赌博机机制设定中由策略性臂引入的挑战。我们进一步表明 -greedy 天生对对抗数据损坏攻击具有鲁棒性,并取得随损坏量线性退化的性能。
引用
@article{arxiv.2307.07675,
title = {On the Robustness of Epoch-Greedy in Multi-Agent Contextual Bandit Mechanisms},
author = {Yinglun Xu and Bhuvesh Kumar and Jacob Abernethy},
journal= {arXiv preprint arXiv:2307.07675},
year = {2023}
}