PersonaBooth:个性化文本到动作生成
计算机视觉与模式识别
2025-03-24 v3
摘要
本文介绍了动作个性化,这是一项新任务,旨在使用包含 Persona 的几个基本动作生成与文本描述对齐的个性化动作。为了支持这一新颖任务,我们引入了一个名为 PerMo (PersonaMotion) 的大规模动作数据集,该数据集捕捉了多个演员的独特 persona。我们还提出了一种针对预训练动作扩散模型的多模态微调方法,称为 PersonaBooth。PersonaBooth 解决了两个主要挑战:i) 以 persona 为中心的 PerMo 数据集与缺乏 persona 特定数据的预训练数据集之间存在显著的分布差距;ii) 难以从内容(动作类型)变化的动作中捕捉一致的 persona。为了解决数据集分布差距,我们引入了 persona token 以接受新的 persona 特征,并在微调期间对文本和视觉进行多模态适配。为了捕捉一致的 persona,我们结合了对比学习技术来增强具有相同 persona 的样本间的内部凝聚力。此外,我们引入了上下文感知融合机制,以最大化整合来自多个输入动作的 persona 线索。PersonaBooth 优于最先进的动作风格迁移方法,为动作个性化建立了新基准。
引用
@article{arxiv.2503.07390,
title = {PersonaBooth: Personalized Text-to-Motion Generation},
author = {Boeun Kim and Hea In Jeong and JungHoon Sung and Yihua Cheng and Jeongmin Lee and Ju Yong Chang and Sang-Il Choi and Younggeun Choi and Saim Shin and Jungho Kim and Hyung Jin Chang},
journal= {arXiv preprint arXiv:2503.07390},
year = {2025}
}