基于半在线偏好优化的文本到运动生成:SoPo
计算机视觉与模式识别
2025-10-21 v3
摘要
文本到运动生成对于推进创意产业至关重要,但往往面临产生一致、真实运动的挑战。为此,我们聚焦于微调文本到运动模型以持续偏好高质量、人类偏好的运动,这是一个至今鲜有人关注的关键问题。在本工作中,我们在在线和离线环境下理论地研究DPO,并揭示了它们各自的局限性:离线DPO易出现过拟合, 在线DPO则可能产生偏差抽样。基于我们的理论见解,我们引入半在线偏好优化(SoPo),一种基于DPO的用于训练文本到运动模型的方法,该方法使用由“半在线”数据对组成,包括来自在线分布的不偏好运动和离线数据集中的偏好运动。该方法允许在线DPO和离线DPO相互补偿,以克服各自的局限性。大量实验表明,SoPo在其他偏好对齐方法中表现更佳。在MLD模型上,MM-Dist为3.25%(相较于例如MoDiPO的0.76%);在MDM模型上为2.91%(相较于例如MoDiPO的0.66%)。此外,经过我们SoPo微调的MLD模型在R-precision和MM Dist方面均超越了SoTA模型。可视化结果也显示了我们SoPo在偏好对齐方面的有效性。项目页面: https://xiaofeng-tan.github.io/projects/SoPo/ .
引用
@article{arxiv.2412.05095,
title = {SoPo: Text-to-Motion Generation Using Semi-Online Preference Optimization},
author = {Xiaofeng Tan and Hongsong Wang and Xin Geng and Pan Zhou},
journal= {arXiv preprint arXiv:2412.05095},
year = {2025}
}