中文

Free-T2M:基于频域的机器人人形化文本到运动生成

计算机视觉与模式识别 2025-11-11 v2

摘要

使人形机器人能够从自然语言命令合成复杂且物理连贯的运动,是自主机器人与人机交互的基石。虽然扩散模型在此文本到运动(T2M)任务中显示出前景,但常生成语义错误或不稳定的运动,限制了其在实际机器人上的应用。本文从频域视角重新定义T2M问题,揭示生成过程类似于分层控制范式。我们识别出两个关键阶段:语义规划阶段,其中低频分量建立全局运动轨迹;细粒度执行阶段,其中高频细节细化运动。为应对每个阶段的挑战,我们引入频域增强文本到运动(Free-T2M)框架,包含阶段特定的频域一致性对齐。我们设计了频域时间自适应模块,以调节不同频带的对齐效果。这些设计确保了基础语义计划的鲁健性,并提升了细节执行的精确性。大量实验表明,我们的方法显著提升了运动质量和语义正确性。尤其当应用于StableMoFusion基线时,Free-T2M将FID从0.152降至0.060,建立了扩散架构中的新型态。这些发现凸显了频域见解在生成可靠且可靠运动中的关键作用,为更直观的自然语言机器人控制铺平了道路。

关键词

引用

@article{arxiv.2501.18232,
  title  = {Free-T2M: Robust Text-to-Motion Generation for Humanoid Robots via Frequency-Domain},
  author = {Wenshuo Chen and Haozhe Jia and Songning Lai and Lei Wang and Yuqi Lin and Hongru Xiao and Lijie Hu and Yutao Yue},
  journal= {arXiv preprint arXiv:2501.18232},
  year   = {2025}
}