借助视觉语言嵌入降低偏好强化学习中的oracle反馈成本
机器学习
2026-03-31 v1
摘要
偏好强化学习可从比较中学习有效奖励函数,但其可扩展性受到oracle反馈高昂成本的限制。轻量级视觉语言嵌入(VLE)模型提供了更便宜的替代方案,但其噪声输出限制其作为独立奖励生成器的有效性。为此,我们提出 ROVED 框架,将 VLE 基于 supervision 与针对性 oracle 反馈相结合。我们的方法使用 VLE 生成分段级偏好,对 uncertainty 高的样本通过过滤机制交由 oracle 处理。此外,我们引入一种参数高效微调方法,将所获取的 oracle 反馈适用于 VLE,以实现协同式改进。这样既保留了嵌入的可扩展性,又保持了 oracle 的准确性,避免了其效率问题。在多个机器人操作任务中,ROVED 在减少 oracle 查询量最高可降低 80% 的同时,匹配或超越了先前的偏好强化学习方法。令人惊讶的是,适配后的 VLE 可跨任务泛化,累计标注成本节省最高可达 90%,凸显了将可扩展嵌入与精确 oracle supervision 组合用于偏好强化学习的实用性。
引用
@article{arxiv.2603.28053,
title = {Reducing Oracle Feedback with Vision-Language Embeddings for Preference-Based RL},
author = {Udita Ghosh and Dripta S. Raychaudhuri and Jiachen Li and Konstantinos Karydis and Amit Roy-Chowdhury},
journal= {arXiv preprint arXiv:2603.28053},
year = {2026}
}
备注
Accepted at ICRA 2026. Project page:https://roved-icra-2026.github.io/