中文

ParTY:用于表达性文本到运动合成的部件指导

计算机视觉与模式识别 2026-03-11 v1

摘要

文本到运动合成旨在从文本描述生成自然且具有表达性的人类动作。虽然现有方法主要聚焦于从文本描述生成整体运动,但难以准确反映涉及特定身体部位的动作。近期的部件级运动生成方法试图解决此问题,但面临两个关键局限:(i)缺乏将文本语义与单个身体部位显式对齐的机制;(ii)由于集成独立生成的部件运动,往往生成不连贯的全身运动。为克服这些问题并解决现有方法所面临的根本权衡,本文提出ParTY框架,在生成连贯的全身运动的同时增强部件表达性。ParTY包括:(1)部件指导网络,首先生成部件运动以获得部件指导,然后利用其生成整体运动;(2)部件感知文本对齐,将文本嵌入进行多样化变换并与每个身体部位恰当地对齐;(3)整体-部件融合,适时融合整体运动与部件运动。大量实验,包括部件水平和连贯性水平评估,表明ParTY在改进前方法方面取得了显著进展。

关键词

引用

@article{arxiv.2603.09611,
  title  = {ParTY: Part-Guidance for Expressive Text-to-Motion Synthesis},
  author = {KunHo Heo and SuYeon Kim and Yonghyun Gwon and Youngbin Kim and MyeongAh Cho},
  journal= {arXiv preprint arXiv:2603.09611},
  year   = {2026}
}

备注

Accepted by CVPR 2026. Code: https://github.com/VisualScienceLab-KHU/ParTY