中文

基于动态层次交互的细粒度文本驱动双人体运动生成

计算机视觉与模式识别 2025-10-10 v1

摘要

人体交互本质上是动态且具有层次结构的,其中动态性指运动随距离的变化,层次结构则从个体到个体间再到整体运动。利用这些特性对于双人体运动生成至关重要,而现有方法几乎以时间不变的方式建模人体交互,忽略了距离和层次结构。为解决这一问题,我们提出了一种细粒度双人体运动生成方法 FineDual,一种三阶段方法,用于从个体到个体间建模动态层次交互。第一阶段——自学习阶段,通过大语言模型将双人体整体文本拆分为个体文本,在个体层面对齐文本特征与运动特征。第二阶段——自适应调整阶段,通过交互距离预测器预测交互距离,利用交互感知图网络在个体间层面动态建模人体交互。第三阶段——教师引导精修阶段,利用整体文本特征作为指导,在整体层面精修运动特征,生成细粒度且高质量的双人体运动。在双人体运动数据集上的大量定量和定性评估表明,所提出的 FineDual 优于现有方法,有效地建模了动态层次人体交互。

关键词

引用

@article{arxiv.2510.08260,
  title  = {Fine-grained text-driven dual-human motion generation via dynamic hierarchical interaction},
  author = {Mu Li and Yin Wang and Zhiying Leng and Jiapeng Liu and Frederick W. B. Li and Xiaohui Liang},
  journal= {arXiv preprint arXiv:2510.08260},
  year   = {2025}
}