面向视觉理解的结构化标签推断
计算机视觉与模式识别
2018-02-20 v1
摘要
图像与视频等视觉数据蕴含丰富的结构化语义标签来源以及广泛的交互组件。视觉内容可被赋予描述主要组件的细粒度标签、刻画高层抽象的粗粒度标签,或揭示属性的一组标签。这种跨越不同交互标签层的分类彰显了以图编码标签信息的潜力。本文中,我们利用此丰富结构在标签空间执行基于图的推断,用于多项任务:多标签图像与视频分类,以及未剪辑视频中的动作检测。我们考虑使用双向推断神经网络(BINN)与结构化推断神经网络(SINN)在标签空间执行基于图的推断,并提出一种基于长短期记忆(LSTM)的扩展以利用未剪辑视频中的活动进展。方法在以下数据集评估:(i)Animal with Attributes (AwA)、Scene Understanding (SUN) 与 NUS-WIDE 数据集用于多标签图像分类;(ii)YouTube-8M 大规模数据集的前两版发布用于多标签视频分类;(iii)THUMOS'14 与 MultiTHUMOS 视频数据集用于动作检测。我们的结果证明了结构化标签推断在这些具挑战性任务中的有效性,相较基线取得显著提升。
引用
@article{arxiv.1802.06459,
title = {Structured Label Inference for Visual Understanding},
author = {Nelson Nauata and Hexiang Hu and Guang-Tong Zhou and Zhiwei Deng and Zicheng Liao and Greg Mori},
journal= {arXiv preprint arXiv:1802.06459},
year = {2018}
}