利用视频中部件级可靠数据的鲁棒动作生成
计算机视觉与模式识别
2025-12-16 v1 人工智能
摘要
从大规模网络视频中提取人体动作为角色动画的数据稀缺问题提供了可扩展的解决方案。然而,由于画外捕捉或遮挡,许多视频帧中的部分人体部位无法被看见。这带来了一个困境:丢弃任何缺失部位的数据会限制规模和多样性,而保留这些数据则会损害数据质量和模型性能。为了解决这个问题,我们提出利用从视频中提取的可靠部件级数据,通过鲁棒的部件感知掩码自回归模型来增强动作生成。首先,我们将人体分解为五个部件,并检测在视频帧中清晰可见的部件作为“可靠”部件。其次,通过我们提出的部件感知变分自编码器将可靠部件编码为潜在 token。第三,我们提出一种鲁棒的部件级掩码生成模型来预测被掩码的可靠部件,同时忽略那些含噪部件。此外,我们贡献了 K700-M,一个包含约 20 万条真实世界动作序列的极具挑战性的新基准,用于评估。实验结果表明,在动作质量、语义一致性和多样性方面,我们的方法在干净和含噪数据集上均成功优于基线方法。项目页面:https://boyuaner.github.io/ropar-main/
引用
@article{arxiv.2512.12703,
title = {Robust Motion Generation using Part-level Reliable Data from Videos},
author = {Boyuan Li and Sipeng Zheng and Bin Cao and Ruihua Song and Zongqing Lu},
journal= {arXiv preprint arXiv:2512.12703},
year = {2025}
}