中文

Read to Play (R2-Play): 结合多模态游戏指令的 Decision Transformer

人工智能 2024-11-19 v7 机器学习

摘要

开发通用智能体是人工智能的长期目标。以往利用来自各种任务的大量离线数据集的方法,在强化学习的多任务场景中展现出了卓越的性能。然而,这些工作在将其能力扩展到新任务时遇到了挑战。最近的方法将文本指导或视觉轨迹整合到决策网络中,以提供特定任务的上下文线索,代表了一个有前景的方向。然而,据观察,仅依赖文本指导或视觉轨迹不足以准确传达任务的上下文信息。本文探索了增强形式的智能体任务指导,使其能够理解游戏指令,从而促进“读后玩”能力。受视觉任务中多模态指令微调成功的启发,我们将基于视觉的强化学习任务视为长程视觉任务,并构建了一组多模态游戏指令,以将指令微调纳入 Decision Transformer 中。实验结果表明,结合多模态游戏指令显著增强了 Decision Transformer 的多任务和泛化能力。

关键词

引用

@article{arxiv.2402.04154,
  title  = {Read to Play (R2-Play): Decision Transformer with Multimodal Game Instruction},
  author = {Yonggang Jin and Ge Zhang and Hao Zhao and Tianyu Zheng and Jarvi Guo and Liuyu Xiang and Shawn Yue and Stephen W. Huang and Zhaofeng He and Jie Fu},
  journal= {arXiv preprint arXiv:2402.04154},
  year   = {2024}
}