中文

学习策略表示以实现可引导的行为合成

机器学习 2026-02-02 v1 人工智能

摘要

给定一个马尔可夫决策过程(MDP),我们寻求学习一系列策略的表示,以促进测试时的行为引导。由于MDP的策略由其占据度量唯一确定,我们提出将策略表示建模为关于占据度量的状态-动作特征映射的期望。我们证明,这些表示可以使用基于集合的架构对一系列策略进行均匀逼近。我们的模型将一组状态-动作样本编码为潜在嵌入,从中我们解码出策略及其对应于多个奖励的值函数。我们使用变分生成方法来诱导一个平滑的潜在空间,并通过对比学习进一步塑造它,使得潜在距离与值函数的差异对齐。这种几何结构允许直接在潜在空间中进行基于梯度的优化。利用这一能力,我们解决了一个新颖的行为合成任务,其中策略被引导以满足未见过的值函数约束,而无需额外训练。

关键词

引用

@article{arxiv.2601.22350,
  title  = {Learning Policy Representations for Steerable Behavior Synthesis},
  author = {Beiming Li and Sergio Rozada and Alejandro Ribeiro},
  journal= {arXiv preprint arXiv:2601.22350},
  year   = {2026}
}