面向基于视频的人体姿态估计的时间特征对齐与互信息最大化
计算机视觉与模式识别
2022-04-05 v2
摘要
多帧人体姿态估计长期以来一直是计算机视觉中一个引人注目且基础性的问题。由于视频中频繁出现的快速运动和姿态遮挡,该任务具有挑战性。最先进的方法努力从相邻帧(支持帧)中引入额外的视觉证据,以促进当前帧(关键帧)的姿态估计。迄今为止被忽视的一个方面是,当前方法直接聚合跨帧的未对齐上下文。当前帧与相邻帧姿态特征之间的空间错位可能导致不理想的结果。更重要的是,现有方法建立在直接的姿态估计损失之上,遗憾的是这无法约束网络充分利用来自相邻帧的有用信息。为解决这些问题,我们提出了一种新颖的分层对齐框架,其利用由粗到细的形变逐步更新相邻帧,以在特征层面上与当前帧对齐。我们进一步提出显式监督从相邻帧提取知识,保证提取出有用的互补线索。为实现这一目标,我们从理论上分析了帧间的互信息,并得出一个最大化任务相关互信息的损失。这些使我们在基准数据集 PoseTrack2017 的多帧人体姿态估计挑战赛中排名第一,并在 Sub-JHMDB 和 Pose-Track2018 基准上取得最先进的性能。我们的代码发布于 https://github.com/Pose-Group/FAMI-Pose,希望能为社区提供帮助。
引用
@article{arxiv.2203.15227,
title = {Temporal Feature Alignment and Mutual Information Maximization for Video-Based Human Pose Estimation},
author = {Zhenguang Liu and Runyang Feng and Haoming Chen and Shuang Wu and Yixing Gao and Yunjun Gao and Xiang Wang},
journal= {arXiv preprint arXiv:2203.15227},
year = {2022}
}
备注
This paper is accepted to CVPR2022 (ORAL presentation)