对抗性扰动下鲁棒的级联带臂赌博机
机器学习
2025-02-13 v1
摘要
在线排序学习从大规模候选集中顺序推荐少量物品给用户,并接收用户的点击反馈。在许多真实场景中,用户按顺序浏览推荐列表,点击第一个有吸引力的物品而不检查其余部分。这类行为通常被建模为级联模型。许多近期工作研究了级联带臂赌博机——级联模型中的在线排序学习框架。然而,如果部分用户反馈被对抗性篡改(例如点击欺诈),现有方法的性能可能显著下降。在本工作中,我们研究了如何在级联带臂赌博机中抵抗对抗性扰动。我们首先构建了「级联带臂赌博机对抗性扰动」(CBAC)问题,假设存在一个可能篡改用户反馈的自适应对手。然后我们为该问题提出了两种鲁棒算法,分别假设扰动水平已知和未知。我们证明,当算法未受攻击时两种算法均可达到对数遗憾,且遗憾随扰动水平线性增长。实验结果也验证了我们方法的鲁棒性。
引用
@article{arxiv.2502.08077,
title = {Cascading Bandits Robust to Adversarial Corruptions},
author = {Jize Xie and Cheng Chen and Zhiyong Wang and Shuai Li},
journal= {arXiv preprint arXiv:2502.08077},
year = {2025}
}