视觉识别的中层表示
计算机视觉与模式识别
2015-12-24 v1
摘要
视觉识别是人工智能的基本挑战之一,其目标是理解视觉数据的语义。特别是,采用中层表示改变了视觉识别的范式。中层图像/视频表示涉及发现并训练一组中层视觉模式(例如部分和属性),并利用它们来表示给定的图像/视频。中层模式可利用视觉现象的运动和表观信息从图像和视频中提取。本论文旨在将中层表示用于不同的高层视觉识别任务,即(i)图像理解和(ii)视频理解。在图像理解方面,我们聚焦于物体检测/识别任务。我们研究发现并学习中层补丁集合,用于表征物体类别的图像。我们特别地以子类感知的网络监督(webly-supervised)方式使用判别性补丁。此外,我们研究了采用基于子类的模型来消除数据集偏差所带来的结果。
引用
@article{arxiv.1512.07314,
title = {Mid-level Representation for Visual Recognition},
author = {Moin Nabi},
journal= {arXiv preprint arXiv:1512.07314},
year = {2015}
}