学习团队决策
最优化与控制
2022-12-23 v1
摘要
在本文中,我们研究线性二次团队决策问题,其中一组智能体在 个时间步上最小化一个凸二次代价函数,约束条件为对自然状态可能不同的线性观测。我们假设自然状态为高斯随机变量,且智能体不知道代价函数以及将自然状态映射到其观测的线性函数。我们提出一种基于梯度下降的算法,在完全信息梯度反馈下期望遗憾为 ,在 bandit 反馈下为 。在 bandit 反馈情形下,期望遗憾具有额外的乘法项 ,其中 反映所学参数的数量。
引用
@article{arxiv.2212.11567,
title = {Learning Team Decisions},
author = {Olle Kjellqvist and Ather Gattami},
journal= {arXiv preprint arXiv:2212.11567},
year = {2022}
}
备注
Accepted and presented at IEEE CDC 2022. A few typos have been corrected