中文

用于训练鲁棒即兴团队协作智能体的最小覆盖集

人工智能 2024-01-04 v2

摘要

由于未见智能体与人类伙伴可能采用多样化的协作约定,与其鲁棒地合作带来了显著挑战。现有即兴团队协作(AHT)方法通过利用最大化特定多样性度量获得的多样化队友策略群体来训练智能体以应对该挑战。然而,先前的基于启发式的多样性度量并不总能在所有协作问题中最大化智能体的鲁棒性。本工作中,我们首先提出,最大化 AHT 智能体的鲁棒性要求其模仿最小覆盖集(MCS)中的策略,即对环境任意伙伴策略的最佳响应策略集合。随后我们引入 L-BRDiv 算法,该算法生成一组队友策略,当用于 AHT 训练时,促使智能体模仿来自 MCS 的策略。L-BRDiv 通过求解一个约束优化问题来联合训练用于 AHT 训练的队友策略,并逼近作为 MCS 成员的 AHT 智能体策略。我们通过实验证明,在更广泛的两人协作问题范围内,L-BRDiv 无需对其目标进行大量超参数调优即可产生比最优方法更鲁棒的 AHT 智能体。我们的研究表明,L-BRDiv 通过优先发现 MCS 中不同的成员而非重复寻找冗余策略,优于基线方法。

关键词

引用

@article{arxiv.2308.09595,
  title  = {Minimum Coverage Sets for Training Robust Ad Hoc Teamwork Agents},
  author = {Arrasy Rahman and Jiaxun Cui and Peter Stone},
  journal= {arXiv preprint arXiv:2308.09595},
  year   = {2024}
}

备注

Accepted at AAAI-24 conference