COBRA:确保诚实策略智能体的上下文赌博机算法
机器学习
2025-05-30 v1 人工智能
机器学习
摘要
本文考虑了一个涉及多个智能体的上下文赌博机问题,其中学习器依次观察上下文和智能体报告的臂,然后选择使系统总奖励最大化的臂。现有的上下文赌博机研究假设智能体会诚实报告其臂,这在许多现实应用中是不切实际的。例如,考虑一个拥有多个卖家的在线平台;一些卖家可能会虚报产品质量以获取优势,例如让平台优先向在线用户推荐他们的产品。为了应对这一挑战,我们提出了一种名为 COBRA 的算法,用于涉及策略智能体的上下文赌博机问题,该算法在不使用任何货币激励的情况下抑制其策略行为,同时具备激励兼容性和次线性遗憾保证。我们的实验结果也验证了所提算法在不同性能方面的表现。
引用
@article{arxiv.2505.23720,
title = {COBRA: Contextual Bandit Algorithm for Ensuring Truthful Strategic Agents},
author = {Arun Verma and Indrajit Saha and Makoto Yokoo and Bryan Kian Hsiang Low},
journal= {arXiv preprint arXiv:2505.23720},
year = {2025}
}
备注
This paper proposes a contextual bandit algorithm that prevents strategic agents from misreporting while having approximate incentive compatibility and a sub-linear regret guarantee