中文

学习团队决策

最优化与控制 2022-12-23 v1

摘要

在本文中,我们研究线性二次团队决策问题,其中一组智能体在 TT 个时间步上最小化一个凸二次代价函数,约束条件为对自然状态可能不同的线性观测。我们假设自然状态为高斯随机变量,且智能体不知道代价函数以及将自然状态映射到其观测的线性函数。我们提出一种基于梯度下降的算法,在完全信息梯度反馈下期望遗憾为 O(log(T))O(\log(T)),在 bandit 反馈下为 O((T))O(\sqrt(T))。在 bandit 反馈情形下,期望遗憾具有额外的乘法项 O(d)O(d),其中 dd 反映所学参数的数量。

关键词

引用

@article{arxiv.2212.11567,
  title  = {Learning Team Decisions},
  author = {Olle Kjellqvist and Ather Gattami},
  journal= {arXiv preprint arXiv:2212.11567},
  year   = {2022}
}

备注

Accepted and presented at IEEE CDC 2022. A few typos have been corrected