面向多博弈决策 Transformer 的目标回报优化器
机器学习
2025-03-05 v1 人工智能
机器人学
摘要
获得在不同博弈和任务中具备鲁棒泛化能力的自主智能体仍然是人工智能研究的终极目标之一。以多博弈决策 Transformer [Lee et al., 2022] 为代表的基于 Transformer 的离线强化学习最新进展,已在各种博弈或任务中展现出卓越的性能。然而,这些方法严重依赖人类专业知识,给实际部署带来了巨大挑战,尤其是在缺乏特定博弈先验知识的场景中。在本文中,我们提出了一种名为多博弈目标回报优化器(MTRO)的算法,仅使用离线数据集在多博弈决策 Transformer 框架内自主确定特定博弈的目标回报。MTRO 通过自动化目标回报配置过程,利用从离线数据集中提取的环境奖励信息,解决了现有局限性。值得注意的是,MTRO 不需要额外训练,能够无缝集成到现有的多博弈决策 Transformer 架构中。我们在 Atari 博弈上的实验评估表明,MTRO 提升了强化学习策略在众多博弈中的性能,凸显了其推动自主智能体开发领域的潜力。
引用
@article{arxiv.2503.02311,
title = {Target Return Optimizer for Multi-Game Decision Transformer},
author = {Kensuke Tatematsu and Akifumi Wachi},
journal= {arXiv preprint arXiv:2503.02311},
year = {2025}
}
备注
10 pages