意图条件下的长期人类自我中心动作预测
计算机视觉与模式识别
2024-04-09 v4
摘要
要预测人类未来的行为,理解人类意图至关重要,因为意图引导人类朝向特定目标。本文中,我们提出一种层次化架构,其假设人类动作序列(低层)可由人类意图(高层)驱动。基于此,我们处理自我中心视频中的长期动作预测任务。我们的框架首先通过层次化多任务MLP Mixer(H3M)在N个已观测视频的人类动作上提取两层人类信息。然后,我们通过意图条件变分自编码器(I-CVAE)对未来的不确定性进行条件化,生成被观测人类可能执行的接下来Z=20个动作的K个稳定预测。通过利用人类意图作为高层信息,我们声称我们的模型能够在长期中预测更具时间一致性的动作,从而在EGO4D挑战赛上改进基线方法的结果。该工作凭借提供更具合理性的预测序列、改进名词与整体动作的预测,在CVPR@2022与ECVV@2022的EGO4D LTA挑战赛中均排名第一。网页:https://evm7.github.io/icvae-page/
引用
@article{arxiv.2207.12080,
title = {Intention-Conditioned Long-Term Human Egocentric Action Forecasting},
author = {Esteve Valls Mascaro and Hyemin Ahn and Dongheui Lee},
journal= {arXiv preprint arXiv:2207.12080},
year = {2024}
}
备注
Winner of CVPR@2022 and ECCV@2022 EGO4D LTA Challenge. Accepted in WACV2023. Webpage: https://evm7.github.io/icvae-page/