结合人类偏好探索文本到动作生成
机器学习
2024-04-16 v1 人工智能
计算机视觉与模式识别
摘要
本文展示了文本到动作生成中偏好学习的探索。我们发现,当前文本到动作生成的改进仍然依赖于需要配备动作捕捉系统的专家标注者的数据集。相反,从人类偏好数据中学习不需要动作捕捉系统;无专业知识的标注者只需比较两个生成的动作。这特别高效,因为评估模型的输出比收集执行特定任务(例如后空翻)的动作更容易。为了开创对这一范式的探索,我们标注了由 MotionGPT 生成的 3,528 个偏好对,标志着研究从偏好数据中学习的各种算法的首次努力。具体而言,我们的探索突出了使用偏好数据时的重要设计选择。此外,我们的实验结果表明,偏好学习有极大改进当前文本到动作生成模型的潜力。我们的代码和数据集已在 https://github.com/THU-LYJ-Lab/InstructMotion}{https://github.com/THU-LYJ-Lab/InstructMotion 公开发布,以进一步促进该领域的研究。
引用
@article{arxiv.2404.09445,
title = {Exploring Text-to-Motion Generation with Human Preference},
author = {Jenny Sheng and Matthieu Lin and Andrew Zhao and Kevin Pruvost and Yu-Hui Wen and Yangguang Li and Gao Huang and Yong-Jin Liu},
journal= {arXiv preprint arXiv:2404.09445},
year = {2024}
}
备注
Accepted to CVPR 2024 HuMoGen Workshop