中文

FineXtrol:通过细粒度文本实现可控运动生成

计算机视觉与模式识别 2025-11-25 v1

摘要

近期研究致力于增强文本驱动运动生成的可控性和精确性。一些方法利用大型语言模型 (LLM) 生成更详细的文本,而另一些方法则将全局 3D 坐标序列作为额外的控制信号。然而,前者常引入不一致的细节且缺乏明确的时间线索,后者在将坐标转换为标准运动表示时计算成本较高。为此,我们提出了 FineXtrol,一种 novel 的控制框架,通过描述特定身体部位随时间的运动的细粒度、时间感知、用户友好且可控的文本控制信号来指导高效运动生成。为支持该框架,我们设计了一个层次化对比学习模块,该模块鼓励文本编码器为我们的 novel 控制信号生成更具辨别力的嵌入,从而提高运动的可控性。定量结果表明,FineXtrol 在可控运动生成方面表现出色,而定性分析则证明了其在指导特定身体部位运动方面的灵活性。

关键词

引用

@article{arxiv.2511.18927,
  title  = {FineXtrol: Controllable Motion Generation via Fine-Grained Text},
  author = {Keming Shen and Bizhu Wu and Junliang Chen and Xiaoqin Wang and Linlin Shen},
  journal= {arXiv preprint arXiv:2511.18927},
  year   = {2025}
}

备注

20 pages, 14 figures, AAAI 2026