TeViR:基于扩散模型的文本到视频奖励用于高效强化学习
机器人学
2025-06-25 v2 人工智能
摘要
开发可扩展且可泛化的强化学习(RL)奖励工程,对于创建通用智能体至关重要,尤其是在具有挑战性的机器人操作领域。虽然近期利用视觉-语言模型(VLM)进行奖励工程的研究已展现出潜力,但其稀疏奖励的特性显著限制了样本效率。本文介绍了 TeViR,一种利用预训练文本到视频扩散模型,通过比较预测图像序列与当前观测来生成密集奖励的新方法。在 11 项复杂机器人任务上的实验结果表明,TeViR 优于利用稀疏奖励的传统方法和其他最先进(SOTA)方法,在没有真实环境奖励的情况下,实现了更好的样本效率和性能。TeViR 在复杂环境中高效引导智能体的能力,凸显了其在推进机器人操作领域强化学习应用的潜力。
引用
@article{arxiv.2505.19769,
title = {TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning},
author = {Yuhui Chen and Haoran Li and Zhennan Jiang and Haowei Wen and Dongbin Zhao},
journal= {arXiv preprint arXiv:2505.19769},
year = {2025}
}