中文

基于流匹配的统一无人数文本到动作生成

计算机视觉与模式识别 2026-03-31 v1

摘要

生成模型在固定数量智能体的动作合成方面表现出色,但在智能体数量可变时难以泛化。基于有限且领域特定的数据,现有方法采用自回归模型递归生成动作,面临效率低下和误差累积的问题。我们提出统一动作流(UMF),由金字塔动作流(P-Flow)和半噪声动作流(S-Flow)组成。UMF 将无人数动作生成分解为单次动作先验生成阶段和多次反应生成阶段。具体而言,UMF 利用统一隐空间桥接异构动作数据集之间的分布差距,实现有效的统一训练。对于动作先验生成,P-Flow 在不同噪声水平下运行于层次化分辨率,从而减轻计算开销。对于反应生成,S-Flow 学习联合概率路径,自适应地执行反应变换和上下文重建,缓解误差累积。大量结果和用户研究证明了 UMF 作为从文本进行多人动作生成的通用模型的有效性。项目页面:https://githubhgh.github.io/umf/。

关键词

引用

@article{arxiv.2603.27040,
  title  = {Unified Number-Free Text-to-Motion Generation Via Flow Matching},
  author = {Guanhe Huang and Oya Celiktutan},
  journal= {arXiv preprint arXiv:2603.27040},
  year   = {2026}
}