具有时变状态的用户推荐系统中的学习激励机制设计
计算机科学与博弈论
2018-04-17 v1 系统与控制
摘要
我们考虑了具有非对称信息的策略性用户如何在用户推荐系统中学习潜在的时变状态的问题。观察到关于状态的私有信号的用户,依次做出购买某种产品的决策,该产品的价值以遍历方式随时间变化。我们将该团队问题表述为分散随机控制问题的一个实例,并刻画了其最优策略。对于策略性用户,我们设计了激励机制使得用户揭示其真实的私有信号,从而使策略性目标与团队目标之间的差距较小,且整体的预期激励支付也较小。
引用
@article{arxiv.1804.05083,
title = {Incentive design for learning in user-recommendation systems with time-varying states},
author = {Deepanshu Vasal and Vijay Subramanian and Achilleas Anastasopoulos},
journal= {arXiv preprint arXiv:1804.05083},
year = {2018}
}
备注
5 pages, 4 figures