基于超网络驱动的低秩适配的风格化文本到运动生成
计算机视觉与模式识别
2026-05-14 v1 人工智能
图形学
机器学习
摘要
文本驱动的运动扩散模型能够生成逼真的人类动作,但文本本身往往难以表达运动的细粒度细节,通常称为风格。近期方法通过在预训练文本驱动扩散模型上附加风格注入机制来解决这一挑战。现有风格化方法要么需要对现有模型进行风格特定的微调,要么依赖重型 ControlNet 架构,限制了效率和对未见风格的泛化。我们提出一种轻量级风格条件框架,通过超网络生成的 LoRA 参数动态调制预训练扩散模型。将风格参考运动编码为全局风格嵌入,通过超网络映射到在扩散模型每个去噪步骤中应用的低秩更新。通过对风格潜在空间进行监督对比损失结构化,本框架可可靠地捕捉多样化的风格属性,提高对未见风格的泛化,并支持基于优化的引导,无需预定义风格类别。在HumanML3D 和 100STYLE 数据集上的实验表明,我们的方法在风格化方面实现了最新的性能,同时对未见风格的风格化效果也得到改善。
引用
@article{arxiv.2605.13333,
title = {Stylized Text-to-Motion Generation via Hypernetwork-Driven Low-Rank Adaptation},
author = {Junhyuk Jeon and Seokhyeon Hong and Junyong Noh},
journal= {arXiv preprint arXiv:2605.13333},
year = {2026}
}
备注
Accepted to SIGGRAPH 2026. Project page: https://junhyukjeon.github.io/projects/style-salad/