无悔学习匹配:马尔可夫匹配市场中的强化学习
机器学习
2022-03-09 v1 人工智能
计算机科学与博弈论
统计理论
统计理论
摘要
我们研究一个涉及计划者与市场两侧一组策略型智能体的马尔可夫匹配市场。每一步,智能体被呈现一个动态上下文,上下文决定效用。计划者控制上下文的转移以最大化累积社会福利,而智能体旨在每一步找到短视稳定匹配。此类设定涵盖包括网约车平台在内的一系列应用。我们通过提出一个集成乐观值迭代与最大权重匹配的强化学习框架来形式化该问题。所提算法应对了序列探索、匹配稳定性与函数逼近的耦合挑战。我们证明该算法实现了次线性后悔。
引用
@article{arxiv.2203.03684,
title = {Learn to Match with No Regret: Reinforcement Learning in Markov Matching Markets},
author = {Yifei Min and Tianhao Wang and Ruitu Xu and Zhaoran Wang and Michael I. Jordan and Zhuoran Yang},
journal= {arXiv preprint arXiv:2203.03684},
year = {2022}
}
备注
40 pages