中文

SAINT:面向离散组合动作空间的基于注意力的策略

机器学习 2026-02-02 v3 人工智能

摘要

许多现实世界动作空间的组合结构导致可能动作的数量呈指数级增长,限制了传统强化学习算法的有效性。近期针对组合动作空间的方法在子动作上施加了因子分解或序列结构,未能捕捉复杂的联合行为。我们引入了基于Transformer的子动作交互网络(SAINT),这是一种新颖的策略架构,它将多分量动作表示为无序集合,并通过以全局状态为条件的自注意力机制来建模其依赖关系。SAINT具有排列不变性、样本高效性,并且与标准策略优化算法兼容。在跨越三个任务领域的18个不同的组合环境中,包括具有1.35×10181.35 \times 10^{18}个可能动作的环境,SAINT始终优于强大的基线方法。

关键词

引用

@article{arxiv.2505.12109,
  title  = {SAINT: Attention-Based Policies for Discrete Combinatorial Action Spaces},
  author = {Matthew Landers and Taylor W. Killian and Thomas Hartvigsen and Afsaneh Doryab},
  journal= {arXiv preprint arXiv:2505.12109},
  year   = {2026}
}