VIRAL:用于奖励设计与学习的视觉基础集成
人工智能
2025-10-29 v3
摘要
人机对齐是当前人工智能领域面临的关键挑战。强化学习旨在最大化奖励函数,尤其容易受到设计不当的奖励函数所带来的风险影响。近期进展表明,用于奖励生成的大型语言模型(LLMs)在此场景下能够超越人类的表现。我们提出了VIRAL,一个通过多模态LLMs生成并优化奖励函数的流水线。VIRAL能够基于给定环境以及目标提示或标注图像,自主创建并交互式地改进奖励函数。优化过程可以结合人类反馈,或由视频LLM生成的描述进行引导,该描述以视频形式解释了智能体的策略。我们在五个Gymnasium环境中对VIRAL进行了评估,结果表明它能加速新行为的学习,同时确保与用户意图的更好对齐。源代码和演示视频见:https://github.com/VIRAL-UCBL1/VIRAL 和 https://youtu.be/Hqo82CxVT38。
引用
@article{arxiv.2505.22092,
title = {VIRAL: Vision-grounded Integration for Reward design And Learning},
author = {Valentin Cuzin-Rambaud and Emilien Komlenovic and Alexandre Faure and Bruno Yun},
journal= {arXiv preprint arXiv:2505.22092},
year = {2025}
}