中文

路由博弈中学习相关均衡的实验研究

计算机科学与博弈论 2022-08-02 v1 人机交互 信息检索 机器学习 系统与控制 系统与控制

摘要

我们研究重复路由博弈中的路径选择,其中不确定的自然状态决定链路延迟函数,且智能体接收私有路径推荐。状态在每轮以独立同分布(i.i.d.)方式从公开已知分布中采样,推荐由随机化策略生成,其从状态到推荐的映射公开已知。在一次博弈设定中,若推荐在后验期望下给出最小行程时间,则称智能体遵从推荐。对重复设定的一个合理推广是:某轮遵从推荐的可能性与之前各轮的遗憾(regret)相关。若遗憾相对于默认选择为满意型(satisficing),且在过往轮次和所有智能体上取平均,则在遵从推荐策略下的渐近结果等同于一次博弈结果。我们报告了一项实验的发现,该实验每次由一名参与者在计算机上进行重复路径选择决策。每轮中,参与者看到各路径的行程时间分布、由遵从策略生成的路径推荐,以及暗示先前参与者对推荐质量平均体验的评分。输入路径选择后,实际行程时间被揭示。参与者通过提交评价来评估推荐质量。该评价与历史评价结合以更新下一轮的评分。对 33 名参与者各进行 100 轮的数据分析表明,显示评分与平均遗憾呈中等负相关,评分与遵从推荐可能性呈强正相关。总体而言,在遵从推荐策略下,评分在实验结束时收敛至接近其最大值,同时伴随极高的遵从推荐频率。

关键词

引用

@article{arxiv.2208.00391,
  title  = {An Experimental Study on Learning Correlated Equilibrium in Routing Games},
  author = {Yixian Zhu and Ketan Savla},
  journal= {arXiv preprint arXiv:2208.00391},
  year   = {2022}
}