面向零样本到达-规避策略的 Decision Transformer 提示
机器学习
2025-05-28 v2 人工智能
定量方法
摘要
离线目标条件强化学习方法在到达-规避任务中展现出了潜力,在这类任务中,智能体必须到达目标状态,同时避开状态空间中不可取的区域。现有方法通常将规避区域信息编码到增广状态空间和成本函数中,这妨碍了在评估时对新型规避区域信息进行灵活、动态的设定。它们还严重依赖精心设计的奖励和成本函数,限制了对复杂或结构不良环境的可扩展性。我们引入了 RADT,一种用于离线、无奖励、目标条件、规避区域条件强化学习的 Decision Transformer 模型。RADT 将目标和规避区域直接编码为提示 token,允许在评估时设定任意数量的任意大小的规避区域。仅使用来自随机策略的次优离线轨迹,RADT 通过目标和规避区域事后重标注的新颖组合来学习到达-规避行为。我们在 11 个任务、环境和实验设置中对 RADT 与 3 个现有的离线目标条件强化学习模型进行了基准测试。RADT 以零样本方式泛化到分布外的规避区域大小和数量,优于需要重新训练的基线。在一个这样的零样本设置中,RADT 在归一化成本上比最佳的重训练基线提高了 35.7%,同时保持了高目标到达成功率。我们将 RADT 应用于生物学中的细胞重编程,尽管存在随机转换和离散的、结构化的状态动力学,它仍减少了在通往目标状态的轨迹中对不可取的中间基因表达状态的访问。
引用
@article{arxiv.2505.19337,
title = {Prompting Decision Transformers for Zero-Shot Reach-Avoid Policies},
author = {Kevin Li and Marinka Zitnik},
journal= {arXiv preprint arXiv:2505.19337},
year = {2025}
}