通过建模抽象目标预测下一步动作
摘要
预测人类动作的问题本质上具有不确定性。然而,如果我们能感知行为者试图实现的目标,便可降低这种不确定性。本文提出一种利用目标信息以减少未来预测不确定性的动作预测模型。由于在推理时我们既无目标信息也无观测动作,我们借助视觉表征来封装动作与目标的信息。由此,我们推导出称为抽象目标的新概念,其以观测到的视觉特征序列为条件用于动作预测。我们将抽象目标设计为一种分布,其参数通过变分循环网络估计。我们对下一步动作采样多个候选,并引入目标一致性度量以确定源自抽象目标的最佳候选。我们的方法在极具挑战性的 Epic-Kitchens55(EK55)、EK100 与 EGTEA Gaze+ 数据集上取得令人印象深刻的成果。相较于先前 EK55 已见厨房(S1)的最先进方法,我们在 Top-1 动词、Top-1 名词与 Top-1 动作预测准确率上分别获得 +13.69、+11.24 与 +5.19 的绝对提升。类似地,我们在未见厨房(S2)集的 Top-1 动词(+10.75)、名词(+5.84)与动作(+2.87)预测上也取得显著提升。EGTEA Gaze+ 数据集上亦观察到相似趋势,名词、动词与动作预测的绝对提升分别为 +9.9、+13.1 与 +6.8。正是通过提交本论文,我们的方法目前成为 EK55 与 EGTEA Gaze+ 动作预测的新最先进方法 https://competitions.codalab.org/competitions/20071#results 代码见 https://github.com/debadityaroy/Abstract_Goal
引用
@article{arxiv.2209.05044,
title = {Predicting the Next Action by Modeling the Abstract Goal},
author = {Debaditya Roy and Basura Fernando},
journal= {arXiv preprint arXiv:2209.05044},
year = {2024}
}
备注
Accepted at the 27th International Conference on Pattern Recognition (ICPR)