通过奖励偏好在人机协作中融入人类灵活性
人工智能
2024-09-26 v2 机器学习
多智能体系统
摘要
基于偏好的强化学习(PbRL)在单智能体环境中取得了显著进展,但尚未在多智能体框架中得到研究。另一方面,对多个智能体(特别是人机协作场景)之间的合作进行建模,同时确保任务成功完成,是一个具有挑战性的问题。为此,我们通过将单智能体 PbRL 扩展至双智能体协作场景,首次对多智能体 PbRL 进行了调查,并将其 formulat 为“人机 PbRL 协作博弈”,其中强化学习智能体向环中的人类查询以引出任务目标及人类对联合团队行为的偏好。在此博弈公式下,我们首先引入了“人类灵活性”的概念,以根据人类是倾向于遵循固定策略还是即时适应强化学习智能体来评估团队性能。其次,我们研究了强化学习智能体对人类策略的不同访问权限。我们强调了沿这两个维度的一个特例,称之为“指定编排”,其中人类灵活性最低且智能体完全访问人类策略。我们通过游戏化的用户研究论证了考虑人类灵活性的必要性以及指定编排的有用性。我们在明确需要强制合作的机器人运动领域评估了用于人机协作设置的最先进 PbRL 算法。我们的发现突出了因人类灵活性和智能体对人类策略访问权限变化而与 PbRL 相关的挑战。最后,我们从用户研究和实证结果中汲取见解,并得出结论:指定编排可被视为未来人机协作场景研究中 PbRL 性能的上限。
引用
@article{arxiv.2312.14292,
title = {Incorporating Human Flexibility through Reward Preferences in Human-AI Teaming},
author = {Siddhant Bhambri and Mudit Verma and Upasana Biswas and Anil Murthy and Subbarao Kambhampati},
journal= {arXiv preprint arXiv:2312.14292},
year = {2024}
}