中文

去中心化协作_bandit_团队中的伙伴感知算法

机器学习 2021-12-17 v2 人工智能 多智能体系统 机器人学 机器学习

摘要

当人类相互协作时,常通过观察他人并考量自身行动对整个团队可能造成的影响来决策,而非贪婪地只做对自身最有利之事。我们希望 AI 智能体也能通过捕捉伙伴模型以类似方式有效协作。本工作中,我们提出并分析了一种带耦合奖励的去中心化多臂_bandit_ (MAB) 问题,作为更一般多智能体协作的抽象。我们表明,将单智能体最优 MAB 算法的朴素扩展应用于去中心化 bandit 团队时会失效。相反,我们提出一种用于联合序贯决策的伙伴感知策略,其扩展了著名的单智能体上置信界算法。我们分析证明所提策略达到对数后悔,并提供涉及人-AI 与人-机器人协作的广泛实验以验证理论发现。结果表明,所提伙伴感知策略优于其他已知方法,且人类受试者研究表明人类更偏好与实现该伙伴感知策略的 AI 智能体协作。

关键词

引用

@article{arxiv.2110.00751,
  title  = {Partner-Aware Algorithms in Decentralized Cooperative Bandit Teams},
  author = {Erdem Bıyık and Anusha Lalitha and Rajarshi Saha and Andrea Goldsmith and Dorsa Sadigh},
  journal= {arXiv preprint arXiv:2110.00751},
  year   = {2021}
}

备注

14 pages, 13 figures. To be presented at "Thirty-Sixth AAAI Conference on Artificial Intelligence (AAAI) 2022". Also presented at "Artificial Intelligence for Human-Robot Interaction (AI-HRI) at AAAI Fall Symposium Series 2021"