基于扩散模型的活动补全用于视频 AI 动作捕捉
计算机视觉与模式识别
2025-05-29 v1 机器学习
摘要
基于 AI 的动作捕捉是一项新兴技术,为传统动作捕捉系统提供了经济高效的替代方案。然而,当前的 AI 动作捕捉方法完全依赖于观测到的视频序列,这与传统动作捕捉类似。这意味着所有人类动作都必须预先定义,并且无法实现观测序列之外的运动。为了解决这一局限性,我们旨在将 AI 动作捕捉应用于虚拟人,这需要观测序列之外的灵活动作。我们假设虽然训练数据中存在许多动作片段,但它们之间的过渡可能缺失。为了弥合这些间隙,我们提出了一种基于扩散模型的动作补全技术,该技术生成互补的人类运动序列,确保运动平滑连续。通过引入门控模块和位置-时间嵌入模块,我们的方法在 Human3.6M 数据集上取得了具有竞争力的结果。我们的实验结果表明:(1) MDC-Net 在 ADE、FDE 和 MMADE 上优于现有方法,但在 MMFDE 上准确度略低;(2) 与 HumanMAC (28.40M) 相比,MDC-Net 的模型尺寸更小 (16.84M);(3) MDC-Net 生成更自然连贯的运动序列。此外,我们提出了一种从人类运动序列中提取传感器数据的方法,包括加速度和角速度。
引用
@article{arxiv.2505.21566,
title = {Diffusion Model-based Activity Completion for AI Motion Capture from Videos},
author = {Gao Huayu and Huang Tengjiu and Ye Xiaolong and Tsuyoshi Okita},
journal= {arXiv preprint arXiv:2505.21566},
year = {2025}
}
备注
32 pages, 16 figures