基于 Mamba 的高效显式关节级交互建模用于文本引导的人物交互生成
计算机视觉与模式识别
2025-04-01 v1
摘要
我们提出了一种用于生成文本引导的人物交互(HOI)的新方法,该方法以计算高效的方式实现了显式关节级交互建模。以往的方法将整个人体表示为单个 token,难以捕捉细粒度的关节级交互,导致生成的 HOI 不真实。然而,将每个单独的关节视为 token 将产生超过二十倍的 token,增加计算开销。为了应对这些挑战,我们引入了高效显式关节级交互模型(EJIM)。EJIM 包含一个双分支 HOI Mamba,用于分别且高效地对时空 HOI 信息进行建模,以及一个双分支条件注入器,用于将文本语义和物体几何集成到人体和物体运动中。此外,我们设计了动态交互块和渐进式掩码机制,以迭代地过滤掉不相关的关节,确保准确且细致的交互建模。在公开数据集上的大量定量和定性评估表明,EJIM 大幅超越了以往的工作,且仅使用 5% 的推理时间。代码可在此获取 \href{https://github.com/Huanggh531/EJIM}{here}。
引用
@article{arxiv.2503.23121,
title = {Efficient Explicit Joint-level Interaction Modeling with Mamba for Text-guided HOI Generation},
author = {Guohong Huang and Ling-An Zeng and Zexin Zheng and Shengbo Gu and Wei-Shi Zheng},
journal= {arXiv preprint arXiv:2503.23121},
year = {2025}
}
备注
Accepted to ICME 2025