基于第一视角视频中接触表征的动作预测
摘要
涉及手部操作的人类动作是根据手与物体接触的建立与断开来构造的,而人类对动作的视觉理解依赖于对接触的预判,认知科学领域的开创性工作已证明了这一点。受此启发,我们引入了以接触为核心的表征与模型,并将其用于动作预测与预判。我们标注了 EPIC Kitchens 数据集的一个子集,以包含手与物体之间的接触时间(time-to-contact)以及手和物体的分割。利用这些标注,我们训练了 Anticipation Module(预判模块),该模块生成 Contact Anticipation Maps(接触预判图)和 Next Active Object Segmentations(下一活动物体分割)——这两种新颖的低层表征提供了预期近期未来动作的时间与空间特征。在 Anticipation Module 之上,我们应用了 Egocentric Object Manipulation Graphs (Ego-OMG),一个用于动作预判与预测的框架。Ego-OMG 通过使用图建模接触界定的动作状态之间的转移,对较长期的时间语义关系进行建模。在 Ego-OMG 中使用 Anticipation Module 取得了最先进(state-of-the-art)的结果,在 EPIC Kitchens Action Anticipation Challenge 的 unseen 和 seen 测试集上分别获得第 1 和第 2 名,并在 EPIC Kitchens 上的动作预判与动作预测任务中取得了最先进的结果。我们对 Anticipation Module 的特征进行了消融实验以评估其作用。
引用
@article{arxiv.2102.00649,
title = {Forecasting Action through Contact Representations from First Person Video},
author = {Eadom Dessalene and Chinmaya Devaraj and Michael Maynord and Cornelia Fermuller and Yiannis Aloimonos},
journal= {arXiv preprint arXiv:2102.00649},
year = {2021}
}
备注
12 pages, 5 figures. in IEEE Transactions on Pattern Analysis and Machine Intelligence, 2021