学习抽象与预测人类动作
计算机视觉与模式识别
2020-08-24 v1
摘要
人类活动自然地结构化为随时间展开的分层结构。对于动作预测,事件序列中的时间关系已被当前方法广泛利用,而其跨不同抽象层次的语义一致性尚未得到充分探索。在本工作中,我们对视频中人类活动的分层结构建模,并展示了该结构在动作预测中的威力。我们提出分层编码器-刷新器-预测器,一种多级神经机器,它可以通过观察部分事件层次结构来学习人类活动的结构,并将该结构展开为多个抽象层次的未来预测。我们还引入了Breakfast Actions视频上新的由粗到细动作标注,以创建一个全面、一致且结构清晰的视频分层活动数据集。通过实验,我们审视并反思了活动预测任务的设置与度量以朝向无偏预测系统评估,并展示了分层建模在可靠且细致的长期动作预测中的作用。
引用
@article{arxiv.2008.09234,
title = {Learning to Abstract and Predict Human Actions},
author = {Romero Morais and Vuong Le and Truyen Tran and Svetha Venkatesh},
journal= {arXiv preprint arXiv:2008.09234},
year = {2020}
}
备注
Accepted for publication in BMVC'20