中文

统一标记表示用于顺序决策模型

机器学习 2025-10-27 v1

摘要

Transformer 在离线强化学习(RL)中通过将轨迹建模为 return-to-go、状态和动作的序列,展示出强大的潜力.然而,现有方法如决策转换器(DT)及其变体存在标记化冗余且注意力复杂度为二次方的限制,制约了其在实时或资源受限环境中的可扩展性.为此,我们提出了统一标记表示(UTR),该方法将 return-to-go、状态和动作合并为单个标记,显著减少序列长度和模型复杂度.理论分析表明,UTR 导致更紧致的 Rademacher 复杂度界,表明其泛化能力更佳.我们进一步开发了两种变体:UTD和UDC,分别基于Transformer和门控CNN骨干网络.两种方法均以显著降低的计算成本实现与最新方法相当或更好的性能.这些发现表明,UTR 能在不同架构之间良好地泛化,并可能为未来大规模决策模型提供高效基础.

关键词

引用

@article{arxiv.2510.21448,
  title  = {Unified token representations for sequential decision models},
  author = {Zhuojing Tian and Yushu Chen},
  journal= {arXiv preprint arXiv:2510.21448},
  year   = {2025}
}