解决零样本人-AI 协作中的协作不兼容问题
人工智能
2024-03-01 v2 人机交互
摘要
在涉及陌生人类的场景中,保障 AI 智能体与实际队友(人类玩家或 AI 智能体)之间的协作仍是零样本协作(Zero-Shot Coordination, ZSC)中的重大挑战。当 AI 智能体未能与某些此前未知的伙伴同步时,协作不兼容问题尤为突出。传统算法旨在通过群体内优化固定目标来与伙伴协作,从而培育策略与行为的多样性。然而,这些技术可能导致学习损失以及无法与群体内特定策略协作,这一现象被称为学习中的协作不兼容。为解决学习中的协作不兼容并有效应对 ZSC 场景下的问题,我们提出协作开放式学习(Cooperative Open-ended LEarning, COLE)框架,该框架借助图论视角对双人协作博弈中的开放式目标进行建模,以评估并定位各策略的协作能力。我们给出两种实用算法,具体为 \algo 与 \algoR,其融合了博弈论与图论的见解。我们从理论与实证分析上表明 COLE 能有效克服协作不兼容。随后,我们搭建了在线 Overcooked 人-AI 实验平台 COLE 平台,支持问卷、模型权重等方面的便捷定制。利用 COLE 平台,我们招募 130 名参与者进行人类实验。研究发现,在多种主观指标上,受试者较最先进方法更偏好我们的方法。此外,Overcooked 游戏环境中的客观实验结果表明,在与未遇过的 AI 智能体及人类代理模型协作时,我们的方法优于现有方法。
引用
@article{arxiv.2306.03034,
title = {Tackling Cooperative Incompatibility for Zero-Shot Human-AI Coordination},
author = {Yang Li and Shao Zhang and Jichen Sun and Wenhao Zhang and Yali Du and Ying Wen and Xinbing Wang and Wei Pan},
journal= {arXiv preprint arXiv:2306.03034},
year = {2024}
}
备注
46 pages. arXiv admin note: substantial text overlap with arXiv:2302.04831