EMAG:来自自我中心视频的自我运动感知且可泛化的2D手部预测
计算机视觉与模式识别
2024-08-26 v2
摘要
从自我中心视频预测未来人类行为是一项具有挑战性但对人类意图理解至关重要的任务。现有的2D手部位置预测方法依赖于视觉表示,主要关注手-物体交互。在本文中,我们研究了手部预测任务,并解决了现有方法中存在的两个重要问题:(1)未来帧中的2D手部位置严重受到自我中心视频中自我运动的影响;(2)基于视觉信息的预测倾向于过度拟合背景或场景纹理,对新颖场景或人类行为的泛化构成挑战。为了解决上述问题,我们提出了EMAG,一种自我运动感知且可泛化的2D手部预测方法。针对第一个问题,我们提出了一种考虑自我运动的方法,自我运动由连续两帧的单应矩阵序列表示。我们进一步利用光流、手和交互物体的轨迹以及自我运动等模态,从而缓解了第二个问题。在两个大规模自我中心视频数据集Ego4D和EPIC-Kitchens 55上的大量实验验证了所提方法的有效性。特别是,我们的模型在数据集内和跨数据集评估中分别比先前方法提高了1.7%和7.0%。项目页面:https://masashi-hatano.github.io/EMAG/
引用
@article{arxiv.2405.20030,
title = {EMAG: Ego-motion Aware and Generalizable 2D Hand Forecasting from Egocentric Videos},
author = {Masashi Hatano and Ryo Hachiuma and Hideo Saito},
journal= {arXiv preprint arXiv:2405.20030},
year = {2024}
}
备注
Accepted at HANDS Workshop@ECCV'24