可微博弈中基于偏好的对手塑形
人工智能
2026-02-02 v1
摘要
多智能体博弈环境中的策略学习是一个具有挑战性的问题。由于每个智能体的奖励由联合策略决定,旨在最大化自身奖励的贪婪学习策略可能会陷入局部最优。最近的研究针对博弈环境提出了对手建模和塑形方法。这些方法通过建模其他智能体的策略和更新过程来提高策略学习的效率。然而,这些方法通常依赖于对对手策略变化的简单预测。由于缺乏对合作和竞争等行为偏好的建模,它们通常仅适用于预定义场景,缺乏泛化能力。在本文中,我们提出了一种新颖的基于偏好的对手塑形(PBOS)方法,通过塑造智能体对合作的偏好来增强策略学习过程。我们引入了偏好参数,并将其纳入智能体的损失函数中,从而允许智能体在更新策略时直接考虑对手的损失函数。我们同时更新偏好参数和策略学习,以确保智能体能够适应任何合作或竞争的博弈环境。通过一系列实验,我们验证了PBOS算法在各种可微博弈中的性能。实验结果表明,PBOS算法能够引导智能体学习合适的偏好参数,从而在多种博弈环境中实现更好的奖励分配。
引用
@article{arxiv.2412.03072,
title = {Preference-based opponent shaping in differentiable games},
author = {Xinyu Qiao and Yudong Hu and Congying Han and Weiyan Wu and Tiande Guo},
journal= {arXiv preprint arXiv:2412.03072},
year = {2026}
}