中文

S-EPOA:基于技能驱动的偏好强化学习以克服段落不可区分性

人工智能 2025-05-14 v3

摘要

基于偏好强化学习(PbRL)的方法通过利用人类偏好作为直接奖励信号,消除了复杂奖励工程的需求。然而,尽管具有巨大潜力,传统 PbRL 方法常受段落不可区分性限制,阻碍学习进程。本文引入技能增强偏好优化算法(S-EPOA),通过整合技能机制到偏好学习框架中以解决段落不可区分性问题。具体而言,我们首先进行无监督预训练以学习有用技能。随后,提出一种新型查询选择机制,在所学习的技能空间中平衡信息增益与可区分性。实验在包括机器人操控和运动等多个任务上表明,S-EPOA 在鲁棒性和学习效率方面显著优于传统 PbRL 方法。结果凸显了技能驱动学习在克服段落不可区分性挑战方面的有效性。

关键词

引用

@article{arxiv.2408.12130,
  title  = {S-EPOA: Overcoming the Indistinguishability of Segments with Skill-Driven Preference-Based Reinforcement Learning},
  author = {Ni Mu and Yao Luan and Yiqin Yang and Bo Xu and Qing-shan Jia},
  journal= {arXiv preprint arXiv:2408.12130},
  year   = {2025}
}

备注

IJCAI 2025