基于不完全信息的大 2 自我对弈强化学习
机器学习
2026-05-29 v1 人工智能
摘要
不完全信息的多人游戏测试智能体能否在隐藏信息、稀疏奖励和非平稳对手的条件下行动。我们在四人不完全信息的牌类游戏 Big 2 中研究这些挑战。我们发展了 Big 2 的自我对弈强化学习框架,使不同策略梯度和值近似方法之间能够进行受控比较。在共同的环境、输入表示、训练预算和评估协议下,PPO 在对抗随机、贪婪和启发式 Big 2 对手时优于蒙特卡洛 Q 近似、SARSA 和 Q 学习。我们进一步发现,适度的熵正则化通过防止策略过于确定性来提高 PPO;而且,当前策略自我对弈在有限预算下的课程方面优于检查点自我对弈或固定对手训练。这些结果表明,Big 2 是一种有用的受控设置,可用于研究深度强化学习在不完全信息、多人交互、延迟奖励和可变动作集合方面的表现。
引用
@article{arxiv.2605.28863,
title = {Self-Play Reinforcement Learning under Imperfect Information in Big 2},
author = {Aalok Patwa},
journal= {arXiv preprint arXiv:2605.28863},
year = {2026}
}
备注
11 pages