多分辨率Haar网络:基于Haar变换增强人体运动预测
计算机视觉与模式识别
2025-05-20 v1
摘要
3D 人体姿态是现代计算机视觉和计算机图形学中的关键内容,其预测近年来受到广泛关注。3D 人体姿态预测旨在从前一序列中预测人的未来运动。忽略人体运动序列的任意性在时空轴上都有明确的来源,限制了最先进方法的性能,导致其在复杂案例(如任意姿势或问候)上难以做出精确预测。为缓解此问题,本文提出了 HaarMoDic 网络,该网络利用 2D Haar 变换将关节投影到更高分辨率坐标系,使网络能够同时访问空间和时间信息。消融研究证明,HaarMoDic 网络中贡献最大的模块是多分辨率Haar(MR-Haar)模块。与仅在两个轴之一或分别提取不同分辨率信息相比,MR-Haar模块通过 2D Haar 变换将整个运动序列投影到混合坐标系中的更高分辨率,从而允许网络在不同分辨率下获取来自两个轴的信息。有了 MR-Haar 模块,HaarMoDic 网络可以参考更广泛的信息进行预测。在 Human3.6M 数据集上进行的实验结果表明,HaarMoDic 在所有测试区间内在 Mean Per Joint Position Error(MPJPE) 指标上超越了最先进的方法。
引用
@article{arxiv.2505.12631,
title = {Multi-Resolution Haar Network: Enhancing human motion prediction via Haar transform},
author = {Li Lin},
journal= {arXiv preprint arXiv:2505.12631},
year = {2025}
}