利用结构上下文模型与排序得分融合进行人体交互预测
计算机视觉与模式识别
2018-06-13 v3
摘要
在交互完全执行前对其进行预测,对于人机交互和视频监控等应用至关重要。在双人交互场景中,两人的全局交互上下文与各自身体部位的局部上下文之间通常存在上下文依赖结构。本文提出学习交互上下文的结构,并将其与视频序列的时空信息相结合,以更好地预测交互类别。结构模型(包括空间模型和时间模型)分别使用长短期记忆(LSTM)网络学习,以捕获每帧RGB图像和每张光流图像的全局与局部上下文依赖关系。LSTM网络还能从全局和局部交互上下文中检测关键信息。此外,为有效结合结构模型与时空模型进行交互预测,还引入了一种排序得分融合方法,以自动计算每个模型在得分融合中的最优权重。在BIT Interaction和UT-Interaction数据集上的实验结果清楚地证明了所提方法的优势。
引用
@article{arxiv.1608.05267,
title = {Leveraging Structural Context Models and Ranking Score Fusion for Human Interaction Prediction},
author = {Qiuhong Ke and Mohammed Bennamoun and Senjian An and Farid Bossaid and Ferdous Sohel},
journal= {arXiv preprint arXiv:1608.05267},
year = {2018}
}