线性情境bandit游戏中保证诚实的机制
机器学习
2025-05-06 v3 计算机科学与博弈论
摘要
情境band问题中,agent依次到达并携带个人情境,系统据此调整臂分配决策,近期因实现更个性化结果而受到关注。然而,在许多医疗和推荐应用中,agent拥有私有档案,可能误报情境以从系统中获利。例如,在自适应临床试验中,医院依次招募志愿者测试多种新疗法并根据志愿者报告的档案(如症状和中期数据)调整计划,参与者可能误报严重副作用如过敏和恶心,以避免被视为次优疗法。我们首次研究私有情境误报在系统与非重复agent之间的随机情境bandit游戏中的此问题。我们表明,传统低后悔算法(如UCB系列算法和Thompson抽样)无法确保诚实报告,最坏情况下可能导致线性后悔;而传统诚实算法如探测后提交(ETC)和-贪心算法虽然可实现亚线性后悔,但代价较高。我们提出一种机制,通过线性规划确保诚实性,同时最小化偏离Thompson抽样,实现频率学后悔。我们的数值实验进一步在多种情境和其他分布族中展示了强性能。
引用
@article{arxiv.2501.03865,
title = {Truthful mechanisms for linear bandit games with private contexts},
author = {Yiting Hu and Lingjie Duan},
journal= {arXiv preprint arXiv:2501.03865},
year = {2025}
}
备注
Accepted by AAMAS 2025