从细粒度文本描述生成人体动作
人工智能
2024-03-27 v2 计算与语言
计算机视觉与模式识别
机器人学
摘要
文本到动作(text2motion)任务是指根据给定的文本描述生成人体动作序列,该模型从自然语言指令映射到人体运动。目前大多数研究局限于粗粒度动作描述(如"一个男人单膝下蹲"),几乎未探索针对相关身体部位动作的细粒度描述。基于粗粒度文本训练的模型可能无法学习从细粒度运动相关词汇映射到运动原语的关系,导致无法生成未见文本描述下的动作。本文构建了一个专注于细粒度文本描述的大规模语言-动作数据集FineHumanML3D,通过对GPT-3.5-turbo输入逐步指令并强制检查伪代码来实现。相应地,我们设计了新的文本到动作模型FineMotionDiffuse,充分利用细粒度文本信息。我们的定量评估显示,FineMotionDiffuse在FineHumanML3D上训练相较于竞争基线改进了0.38的FID分数。根据定性评估与案例研究,我们的模型在生成空间或时间上组合化动作方面优于MotionDiffuse,通过学习细粒度描述到相应基本动作的隐式映射。我们将在https://github.com/KunhangL/finemotiondiffuse发布数据。
引用
@article{arxiv.2403.13518,
title = {Motion Generation from Fine-grained Textual Descriptions},
author = {Kunhang Li and Yansong Feng},
journal= {arXiv preprint arXiv:2403.13518},
year = {2024}
}