FineMotion:面向细粒度运动生成与编辑的数据集与基准
计算机视觉与模式识别
2025-07-29 v1
摘要
从文本描述生成逼真的人类运动已取得显著进展。然而,现有方法常常忽视特定身体部位的运动及其时序。在本文中,我们通过丰富文本描述来解决此问题。具体而言,我们提出了 FineMotion 数据集,其中包含超过 44 万个人类运动片段——即人类运动序列的短暂段落——以及这些片段对应细致的人体部位运动描述。此外,该数据集约包含 9.5 万段详细段落,描述整个运动序列中人体部位的运动。实验结果表明,FineMotion 数据集在文本驱动的细粒度人类运动生成任务中具有重要意义,尤其是对 MDM 模型实现了约 +15.3% 的 Top-3 准确率提升。值得一提的是,我们进一步支持一种零样本细粒度运动编辑管线,聚焦于文本驱动的时空维度上的详细编辑。数据集和代码均可在 CVI-SZU/FineMotion 获取。
引用
@article{arxiv.2507.19850,
title = {FineMotion: A Dataset and Benchmark with both Spatial and Temporal Annotation for Fine-grained Motion Generation and Editing},
author = {Bizhu Wu and Jinheng Xie and Meidan Ding and Zhe Kong and Jianfeng Ren and Ruibin Bai and Rong Qu and Linlin Shen},
journal= {arXiv preprint arXiv:2507.19850},
year = {2025}
}