中文

COBRA:确保诚实策略智能体的上下文赌博机算法

机器学习 2025-05-30 v1 人工智能 机器学习

摘要

本文考虑了一个涉及多个智能体的上下文赌博机问题,其中学习器依次观察上下文和智能体报告的臂,然后选择使系统总奖励最大化的臂。现有的上下文赌博机研究假设智能体会诚实报告其臂,这在许多现实应用中是不切实际的。例如,考虑一个拥有多个卖家的在线平台;一些卖家可能会虚报产品质量以获取优势,例如让平台优先向在线用户推荐他们的产品。为了应对这一挑战,我们提出了一种名为 COBRA 的算法,用于涉及策略智能体的上下文赌博机问题,该算法在不使用任何货币激励的情况下抑制其策略行为,同时具备激励兼容性和次线性遗憾保证。我们的实验结果也验证了所提算法在不同性能方面的表现。

关键词

引用

@article{arxiv.2505.23720,
  title  = {COBRA: Contextual Bandit Algorithm for Ensuring Truthful Strategic Agents},
  author = {Arun Verma and Indrajit Saha and Makoto Yokoo and Bryan Kian Hsiang Low},
  journal= {arXiv preprint arXiv:2505.23720},
  year   = {2025}
}

备注

This paper proposes a contextual bandit algorithm that prevents strategic agents from misreporting while having approximate incentive compatibility and a sub-linear regret guarantee