中文

奖励感知的原型表示在强化学习中的应用

计算与语言 2025-09-24 v2

摘要

在近年来,继后表示 (Successor Representation, SR) 在强化学习 (RL) 中受到日益关注,并被用于解决诸如探索、信用分配和泛化等关键挑战。SR 可视为通过隐式编码其诱导的转换动力学来表示环境底层信用分配结构。然而,SR 是奖励不可感知的。本文讨论了一种类似表示,同时考虑问题的奖励动力学。我们研究了一种最近提出的表示——默认表示 (Default Representation, DR),该表示在理论(和实证)分析方面有限。本文在表格情形下为 DR 提立一些理论基础,通过 (1) 推导动态规划和 (2) 时序差分方法来学习 DR, (3) 描述 DR 向量空间的基,以及 (4) 通过默认特征正式扩展 DR 到函数逼近情形。实证方面,我们分析了 DR 在 SR 所应用的许多情形中的优势,包括 (1) 奖励塑形, (2) 选项发现, (3) 探索,以及 (4) 迁移学习。我们的结果表明,与 SR 相比,DR 产生了质质不同的、奖励感知的行为,并在几个情形中实现量化更好的性能。

关键词

引用

@article{arxiv.2505.16216,
  title  = {Memorization or Reasoning? Exploring the Idiom Understanding of LLMs},
  author = {Jisu Kim and Youngwoo Shin and Uiji Hwang and Jihun Choi and Richeng Xuan and Taeuk Kim},
  journal= {arXiv preprint arXiv:2505.16216},
  year   = {2025}
}

备注

EMNLP 2025