通过最佳响应多样性生成队友以训练鲁棒即兴团队协作智能体
机器学习
2023-05-25 v3 人工智能
摘要
即兴团队协作(AHT)的挑战在于设计一种鲁棒的学习智能体,能在无先验协调机制的情况下与未知队友有效协作。早期方法通过用一组多样化的手工队友策略训练学习器来应对AHT挑战,这些策略通常基于专家对学习者可能遇到的策略的领域知识设计。然而,基于领域知识实现用于训练的队友策略并非总是可行。在此类情况下,近期方法试图通过用优化信息论多样性度量生成的队友策略训练学习器来提升其鲁棒性。为生成队友策略而优化现有信息论多样性度量的问题在于会出现表面不同实则相似的队友。当用于AHT训练时,表面不同的队友行为可能无法提升学习器与未知队友协作时的鲁棒性。本文提出一种自动化队友策略生成方法,优化最佳响应多样性(BRDiv)度量,该度量基于队友策略在回报上的兼容性衡量多样性。我们在具有多种有效协调策略的环境中评估了我们的方法,与优化信息论多样性度量的方法以及不优化任何多样性度量的消融实验进行比较。实验表明,优化BRDiv产生多样化的训练队友策略集,在与近最优且先前未见的队友策略协作时,相对于先前的队友生成方法提升了学习器的性能。
引用
@article{arxiv.2207.14138,
title = {Generating Teammates for Training Robust Ad Hoc Teamwork Agents via Best-Response Diversity},
author = {Arrasy Rahman and Elliot Fosong and Ignacio Carlucho and Stefano V. Albrecht},
journal= {arXiv preprint arXiv:2207.14138},
year = {2023}
}
备注
Accepted in Transactions of Machine Learning Research