Poseidon:基于可适应帧权重和多尺度特征融合的 ViT 架构用于多帧姿态估计
计算机视觉与模式识别
2025-01-27 v1
摘要
人体姿态估计是计算机视觉中的一项关键任务,涉及检测和局化图像和视频中的人体关节。虽然单帧姿态估计取得了显著进展,但往往难以捕捉复杂连续运动的时序动态。我们提出了 Poseidon,一种新的多帧姿态估计架构,通过集成时间信息来增强准确性和对复杂视频情景的鲁棒性。Poseidon 引入了关键创新:(1)一种可适应帧权重(AFW)机制,动态优先于最相关的帧,确保模型关注最具信息性的数据;(2)一种多尺度特征融合(MSFF)模块,用于聚合来自不同 backbone 层的特征,以捕捉细粒度细节和高层次语义;(3)一种跨注意力模块,用于在中心帧和上下文帧之间实现有效的信息交换,增强模型的时序一致性。该方法在复杂视频情景中提升了性能,同时具备适用于实际应用的可扩展性和计算效率。我们的做法在 PoseTrack21 和 PoseTrack18 数据集上实现了状态-of-the-art 性能,分别获得 88.3 和 87.8 的 mAP 分数,超越了现有方法。
引用
@article{arxiv.2501.08446,
title = {Poseidon: A ViT-based Architecture for Multi-Frame Pose Estimation with Adaptive Frame Weighting and Multi-Scale Feature Fusion},
author = {Cesare Davide Pace and Alessandro Marco De Nunzio and Claudio De Stefano and Francesco Fontanella and Mario Molinara},
journal= {arXiv preprint arXiv:2501.08446},
year = {2025}
}