中文

学习目的导向可控状态表示

人工智能 2025-08-06 v3

摘要

目的导向行为的计算模型包含描述性和 prescription 两个方面, 分别用于确定和评估世界中的情境。在强化学习中, prescription奖励函数假设依赖于预定义且固定的描述性状态表示。或者, 这两个方面可以相互依赖: 目标可以塑造所获取的状态表示, 反之亦然。本文提出了一种用于受限智能体状态表示学习的计算框架, 其中描述性和 prescription 方面通过目标导向或目的(telic)状态的概念进行耦合。我们引入了telic可控性概念来刻画telic状态表示粒度与实现到达所有telic状态所需的策略复杂性之间的权衡。我们提出了一种学习telic可控状态表示的算法, 通过模拟导航任务进行演示。本框架突显了刻意忽略--即知道要忽略什么--在学习平衡目标灵活性和认知复杂性的状态表示方面的作用。

关键词

引用

@article{arxiv.2406.14476,
  title  = {Learning telic-controllable state representations},
  author = {Nadav Amir and Stas Tiomkin},
  journal= {arXiv preprint arXiv:2406.14476},
  year   = {2025}
}

备注

Published in Proceedings of the 47th Annual Meeting of the Cognitive Science Society