激励式在线学习的社会最优机制设计
计算机科学与博弈论
2021-12-30 v1 人工智能
摘要
多臂老虎机(MAB)是一种研究不确定环境中序贯决策的经典在线学习框架。然而,MAB框架忽略了决策者在无法直接采取行动(例如拉动臂)的情形。这在许多应用中是一个实际重要的场景,如频谱共享、众包感知和边缘计算。在这些应用中,决策者会激励其他自私的智能体来执行期望的动作(即代表决策者拉动臂)。本文为这一场景建立了激励式在线学习(IOL)框架。设计IOL框架的关键挑战在于未知环境学习与不对称信息揭示的紧密耦合。为此,我们构建了一个特殊的拉格朗日函数,并基于此提出了一种用于IOL框架的社会最优机制。我们的机制满足多种理想性质,如智能体公平性、激励相容性和自愿参与性。它达到了与需要额外信息的最先进基准相同的渐近性能。我们的分析还揭示了IOL框架中群体的力量:更大的智能体群体使我们的机制能够更接近社会性能的理论上界。数值结果展示了我们的机制在大规模边缘计算中的优势。
引用
@article{arxiv.2112.14338,
title = {Socially-Optimal Mechanism Design for Incentivized Online Learning},
author = {Zhiyuan Wang and Lin Gao and Jianwei Huang},
journal= {arXiv preprint arXiv:2112.14338},
year = {2021}
}