基于互信息的时序差分学习用于视频人体姿态估计
计算机视觉与模式识别
2023-05-09 v2
摘要
时序建模对于多帧人体姿态估计至关重要。大多数现有方法直接采用光流或可变形卷积来预测全谱运动场,这可能引入大量无关线索,例如邻近的人或背景。若不加进一步努力挖掘有意义的运动先验,其结果在复杂的时空交互下是次优的。另一方面,时序差分能够编码具有代表性的运动信息,这些信息对姿态估计潜在有价值但未被充分利用。本文提出一种新颖的多帧人体姿态估计框架,其利用跨帧时序差分建模动态上下文,并从客观互信息角度促进有用运动信息解耦。具体而言,我们设计了一个多阶段时序差分编码器,其在多阶段特征差分序列条件下执行增量级联学习以推导信息丰富的运动表示。我们进一步从互信息角度提出表示解耦模块,该模块通过显式定义原始运动特征中有用与噪声成分并最小化其互信息,来掌握判别性的任务相关运动信号。这些使我们在基准数据集HiEve的复杂事件人群姿态估计挑战赛中排名第一,并在三个基准PoseTrack2017、PoseTrack2018和PoseTrack21上取得最先进性能。
引用
@article{arxiv.2303.08475,
title = {Mutual Information-Based Temporal Difference Learning for Human Pose Estimation in Video},
author = {Runyang Feng and Yixing Gao and Xueqing Ma and Tze Ho Elden Tse and Hyung Jin Chang},
journal= {arXiv preprint arXiv:2303.08475},
year = {2023}
}
备注
This paper is accepted to CVPR 2023