TriC-Motion:基于三域因果建模的文本到运动生成
计算机视觉与模式识别
2026-02-10 v1
摘要
文本到运动生成是计算机视觉领域中日益快速发展的研究方向,旨在产生逼真且文本对齐的运动序列。当前方法主要聚焦于时空建模或独立的频率域分析,缺乏跨时空域联合优化的统一框架。这种限制阻碍了模型同时利用来自所有域的信息,从而导致生成质量次优。此外,在运动生成框架中,由噪声引起的与运动无关的线索常与有助于生成的特征纠缠,从而导致运动失真。为此,我们提出了三域因果文本到运动生成(TriC-Motion),一种集成时空域频率域建模与因果干预的扩散基框架。TriC-Motion包括三个核心建模模块,用于域特定建模,即Temporal Motion Encoding、Spatial Topology Modeling 和 Hybrid Frequency Analysis。经过全面建模后,Score-guided Tri-domain Fusion 模块整合了来自三个域的有价值信息,同时确保时序一致性、空间拓扑、运动趋势和动态。此外,Causality-based Counterfactual Motion Disentangler 经过精心设计,以暴露运动无关线索以消除噪声,使每个域的真实建模贡献得以脱离,实现更佳的生成。大量实验结果表明,TriC-Motion 在与最先进的方法相比时实现了卓越的性能,在 HumanML3D 数据集上实现了 R@1 为 0.612 的突出成绩。这些结果表明其能够生成高保真、连贯、多样且文本对齐的运动序列。代码可在 https://caoyiyang1105.github.io/TriC-Motion/ 查看。
引用
@article{arxiv.2602.08462,
title = {TriC-Motion: Tri-Domain Causal Modeling Grounded Text-to-Motion Generation},
author = {Yiyang Cao and Yunze Deng and Ziyu Lin and Bin Feng and Xinggang Wang and Wenyu Liu and Dandan Zheng and Jingdong Chen},
journal= {arXiv preprint arXiv:2602.08462},
year = {2026}
}