基于第一视角视频的下一活跃对象预测
计算机视觉与模式识别
2019-04-11 v1 人工智能
机器学习
摘要
尽管第一人称视觉系统能从用户视角感知环境,它们通常无法预测其意图与目标。由于人类活动可按原子动作及与对象的交互来分解,智能可穿戴系统将受益于预见用户-对象交互的能力。即便该任务并不简单,第一人称视觉范式可提供重要线索以应对此挑战。我们提出利用场景动态来在对象交互开始前识别下一活跃对象。我们训练一个分类器,以区分导向对象激活的轨迹与所有其他轨迹,并通过在时序滑动窗口内分析定长轨迹段来预测下一活跃对象。所提方法在包含20名受试者执行无约束多对象交互所采集的10小时视频的每日活动(ADL)第一人称数据集上,相对于若干基线表现更优。
引用
@article{arxiv.1904.05250,
title = {Next-Active-Object prediction from Egocentric Videos},
author = {Antonino Furnari and Sebastiano Battiato and Kristen Grauman and Giovanni Maria Farinella},
journal= {arXiv preprint arXiv:1904.05250},
year = {2019}
}