中文

MoMo: 条件对比表示学习用于偏好调制规划

机器学习 2026-05-15 v2

摘要

时序对比表示学习诱导一种低维线性系统中可进行推断的潜在结构。然而,现有的对比规划工作学习单一潜在几何,无法区分相同 start-goal 查询下在任务效率与风险暴露之间进行权衡的多个有效行为。我们引入 MoMo,一种 preference-conditioned 对比规划器,允许标量用户偏好在推断时连续调制计划的保守程度,而无需重新训练。MoMo 通过 Feature-Wise Linear 调制和低秩神经调制,分别学习表示几何和潜在预测算子的联合条件。我们展示了该公式保留表示空间中必需的概率密度比,用于推断驱动的对比规划,同时保持其推断效率。跨六个环境,MoMo 能平滑地根据用户偏好调整计划安全性,相较于状态增强基线,在时序一致性和偏好一致性方面实现改进。

关键词

引用

@article{arxiv.2605.08512,
  title  = {MoMo: Conditioned Contrastive Representation Learning for Preference-Modulated Planning},
  author = {Yusuf Syed and Viraj Parimi and Brian Williams},
  journal= {arXiv preprint arXiv:2605.08512},
  year   = {2026}
}