连续视频流中的联合事件检测与描述
计算机视觉与模式识别
2018-12-27 v3
摘要
密集视频描述是一项细粒度视频理解任务,涉及两个子问题:在长视频流中定位不同的事件,以及为定位到的事件生成描述。我们提出了联合事件检测与描述网络(JEDDi-Net),以端到端的方式解决密集视频描述任务。我们的模型利用三维卷积层对输入视频流进行连续编码,基于池化特征提出变长时间事件,并生成其描述。通过从共享视频特征编码中进行三维感兴趣段(Segment-of-Interest)池化,在每个提案片段内提取提案特征。为了显式建模单个视频中视觉事件与其描述之间的时间关系,我们还提出了一种保持上下文的两级层次化描述模块。在大规模 ActivityNet Captions 数据集上,JEDDi-Net 在标准指标衡量下展现出改进的结果。我们还给出了在 TACoS-MultiLevel 数据集上的首个密集描述结果。
引用
@article{arxiv.1802.10250,
title = {Joint Event Detection and Description in Continuous Video Streams},
author = {Huijuan Xu and Boyang Li and Vasili Ramanishka and Leonid Sigal and Kate Saenko},
journal= {arXiv preprint arXiv:1802.10250},
year = {2018}
}
备注
WACV2019