中文

默认表示在强化学习中基于图优化的目标

机器学习 2026-02-03 v1

摘要

在计算强化学习中,默认表示(DR)及其主特征向量被证明对各种应用有效,包括奖励塑形、计数基础探索、选项发现和迁移。然而,在先前的研究中,DR 的特征向量是通过首先近似 DR 矩阵,然后进行特征分解来计算的。这一程序计算昂贵,难以扩展到高维空间。本文推导了直接使用神经网络逼近 DR 主特征向量的目标。我们在多个环境中经验性地证明了该目标的有效性,并将所学特征向量用于奖励塑形。

关键词

引用

@article{arxiv.2602.00403,
  title  = {DROGO: Default Representation Objective via Graph Optimization in Reinforcement Learning},
  author = {Hon Tik Tse and Marlos C. Machado},
  journal= {arXiv preprint arXiv:2602.00403},
  year   = {2026}
}