中文

PrefMMT:用于偏好基强化学习中的人类偏好建模的多模态 Transformer

机器人学 2025-03-12 v2

摘要

偏好基强化学习(PbRL)在机器人行为与人类偏好对齐方面显示出巨大的潜力,但其成功性高度依赖于通过奖励模型准确建模人类偏好。大多数方法为偏好建模(PM)采取马尔可夫假设,忽略了对人类评估产生影响的机器人行为轨迹中存在的时序依赖性。虽然近期研究利用序列建模来缓解这一问题,学习顺序非马尔可夫奖励,但它们忽略了机器人轨迹的多模态特性,这些轨迹由两种不同模态的元素组成:状态和动作。因此,这些方法往往难以捕捉这些模态之间复杂相互作用,这些相互作用对人类偏好具有重大影响。本文提出一种用于 PM 的多模态序列建模方法,通过解耦状态和动作模态来实现。我们引入一种名为 PrefMMT 的多模态 Transformer 网络,层次性地利用内部模态的时序依赖性和跨模态的状态-动作相互作用,以捕捉复杂的偏好模式。我们在 D4RL 基准的 locomotion 任务和 Meta-World 基准的操作任务上 demonstrate,该方法持续优于最新的 PM baseline。

关键词

引用

@article{arxiv.2409.13683,
  title  = {PrefMMT: Modeling Human Preferences in Preference-based Reinforcement Learning with Multimodal Transformers},
  author = {Dezhong Zhao and Ruiqi Wang and Dayoon Suh and Taehyeon Kim and Ziqin Yuan and Byung-Cheol Min and Guohua Chen},
  journal= {arXiv preprint arXiv:2409.13683},
  year   = {2025}
}