中文

探索运动-语言对齐用于文本驱动的运动生成

计算机视觉与模式识别 2026-04-06 v1

摘要

文本驱动的人体运动生成旨在合成遵循文本描述的真实运动序列。尽管近期取得了进展,但准确对齐运动动力学与文本语义仍然是一个基本挑战。在本文中,我们从运动-语言对齐的角度重新审视文本到运动生成,并提出了 MLA-Gen,一个将全局运动先验与细粒度局部条件化相集成的框架。该设计使模型能够捕捉常见的运动模式,同时建立文本与运动之间的详细对齐。此外,我们在人体运动生成中识别出一个先前被忽视的注意力沉没现象,即注意力不成比例地集中在起始文本令牌上,限制了信息文本线索的利用,导致语义锚定退化。为分析此问题,我们引入了 SinkRatio,一个衡量注意力集中度的指标,并开发了感知对齐的掩码和控制策略以调节生成过程中的注意力。广泛的实验证明我们的方法在运动质量和运动-语言对齐方面持续优于强基线。代码将在接受后发布。

关键词

引用

@article{arxiv.2604.02973,
  title  = {Exploring Motion-Language Alignment for Text-driven Motion Generation},
  author = {Ruxi Gu and Zilei Wang and Wei Wang},
  journal= {arXiv preprint arXiv:2604.02973},
  year   = {2026}
}

备注

10 pages, 8 figures