释放预训练 LLM 用于运动相关多模态生成:统一扩散与下一词预测的微调方法
机器学习
2025-03-11 v1
摘要
在本文中,我们提出了一个统一框架,利用单个预训练 LLM 进行运动相关多模态生成,称为 MoMug。MoMug 通过微调预训练 LLM,将基于扩散的连续运动生成与模型固有的自回归离散文本预测能力相结合。这使得在单个模型架构内能够无缝切换连续运动输出和离散文本词元预测,有效地结合了基于扩散和基于 LLM 方法的优势。实验结果表明,与最新的基于 LLM 的基线相比,MoMug 在文本到运动任务上的 FID 提高了 38%,七项指标的平均准确率提高了 16.61%。此外,它在文本到运动任务上的八项指标平均准确率提高了 8.44%。据我们所知,这是首次在单个模型中集成基于扩散和基于 LLM 的生成以处理运动相关多模态任务的方法,同时保持了低训练成本。这为未来运动相关生成的进步奠定了基础,为高质量且高性价比的运动合成铺平了道路。
引用
@article{arxiv.2503.06119,
title = {Unlocking Pretrained LLMs for Motion-Related Multimodal Generation: A Fine-Tuning Approach to Unify Diffusion and Next-Token Prediction},
author = {Shinichi Tanaka and Zhao Wang and Yoichi Kato and Jun Ohya},
journal= {arXiv preprint arXiv:2503.06119},
year = {2025}
}