MotionRL:利用多奖励强化学习将文本到运动生成对齐人类偏好
计算机视觉与模式识别
2024-10-10 v1
摘要
我们提出 MotionRL,是首个利用多奖励强化学习(RL)优化文本到运动生成任务并将其与人类偏好对齐的方法。以往工作关注提高给定数据集上的数值性能指标,往往忽视了人类反馈的可变性和主观性。相比之下,我们的新方法使用强化学习基于人类偏好先验知识对运动生成器进行微调,使其生成更符合人类偏好的运动。此外,MotionRL 引入一种新的多目标优化策略,以近似实现文本遵循性、运动质量和人类偏好之间的帕累托最优。广泛的实验和用户研究表明,MotionRL 不仅能够在不同目标之间控制生成结果,还在这些指标上显著优于其他算法。
引用
@article{arxiv.2410.06513,
title = {MotionRL: Align Text-to-Motion Generation to Human Preferences with Multi-Reward Reinforcement Learning},
author = {Xiaoyang Liu and Yunyao Mao and Wengang Zhou and Houqiang Li},
journal= {arXiv preprint arXiv:2410.06513},
year = {2024}
}