用于识别在位智能体动作的场景布局诱导视频表示
计算机视觉与模式识别
2019-04-02 v3
摘要
我们解决在位智能体动作(agent-in-place actions)的识别问题,此类动作与执行它们的智能体及发生它们的场所相关联,研究背景为室外家庭监控。我们引入场景布局的几何与拓扑表示,以使网络能从训练集中观察到的布局泛化到测试集中未见的布局。该布局诱导视频表示(LIVR)剔除了低层外观差异,并编码特定场景布局中场所之间的几何与拓扑关系。LIVR将视频片段的语义特征划分到不同场所,以迫使网络学习基于场所的特征描述;为预测每个动作的置信度,LIVR聚合与某动作相关的场所及其在场景布局上相邻场所的特征。我们引入在位智能体动作数据集以表明我们的方法使神经网络模型对未见场景的泛化能力显著更好。
引用
@article{arxiv.1804.01429,
title = {Layout-induced Video Representation for Recognizing Agent-in-Place Actions},
author = {Ruichi Yu and Hongcheng Wang and Ang Li and Jingxiao Zheng and Vlad I. Morariu and Larry S. Davis},
journal= {arXiv preprint arXiv:1804.01429},
year = {2019}
}