默认表示在强化学习中基于图优化的目标
机器学习
2026-02-03 v1
摘要
在计算强化学习中,默认表示(DR)及其主特征向量被证明对各种应用有效,包括奖励塑形、计数基础探索、选项发现和迁移。然而,在先前的研究中,DR 的特征向量是通过首先近似 DR 矩阵,然后进行特征分解来计算的。这一程序计算昂贵,难以扩展到高维空间。本文推导了直接使用神经网络逼近 DR 主特征向量的目标。我们在多个环境中经验性地证明了该目标的有效性,并将所学特征向量用于奖励塑形。
引用
@article{arxiv.2602.00403,
title = {DROGO: Default Representation Objective via Graph Optimization in Reinforcement Learning},
author = {Hon Tik Tse and Marlos C. Machado},
journal= {arXiv preprint arXiv:2602.00403},
year = {2026}
}