中文

线性情境bandit游戏中保证诚实的机制

机器学习 2025-05-06 v3 计算机科学与博弈论

摘要

情境band问题中,agent依次到达并携带个人情境,系统据此调整臂分配决策,近期因实现更个性化结果而受到关注。然而,在许多医疗和推荐应用中,agent拥有私有档案,可能误报情境以从系统中获利。例如,在自适应临床试验中,医院依次招募志愿者测试多种新疗法并根据志愿者报告的档案(如症状和中期数据)调整计划,参与者可能误报严重副作用如过敏和恶心,以避免被视为次优疗法。我们首次研究私有情境误报在系统与非重复agent之间的随机情境bandit游戏中的此问题。我们表明,传统低后悔算法(如UCB系列算法和Thompson抽样)无法确保诚实报告,最坏情况下可能导致线性后悔;而传统诚实算法如探测后提交(ETC)和ϵ\epsilon-贪心算法虽然可实现亚线性后悔,但代价较高。我们提出一种机制,通过线性规划确保诚实性,同时最小化偏离Thompson抽样,实现O(lnT)O(\ln T)频率学后悔。我们的数值实验进一步在多种情境和其他分布族中展示了强性能。

关键词

引用

@article{arxiv.2501.03865,
  title  = {Truthful mechanisms for linear bandit games with private contexts},
  author = {Yiting Hu and Lingjie Duan},
  journal= {arXiv preprint arXiv:2501.03865},
  year   = {2025}
}

备注

Accepted by AAMAS 2025