用于多示例图像分类的多视图度量学习
计算机视觉与模式识别
2016-10-24 v1
摘要
进行图像分类是关键且有意义的,因为它可以在图像检索与识别、目标检测等方面为人类提供帮助。在本文中,我们从三个方面努力来完成这项任务。首先,提取具有 bag-of-words 表示而非单一向量的视觉特征来刻画图像。为了提高性能,实现了多视图学习的思想,并提供了三种特征,每种特征对应一个单一视图。来自三个视图的信息相互互补,可以统一在一起。然后,通过计算实例之间距离的加权和,设计了一种新的包距离函数。我们探索了度量学习技术,以构建一个数据相关的距离度量,从而更准确地度量实例之间、包与图像之间的关系。最后,提出了一种名为 MVML 的新方法,该方法优化了每幅图像与其最近邻图像相似的概率。MVML 学习多个距离度量,每个度量对一个单一视图建模,以统一来自多个视图的信息。该方法可以通过交替优化迭代求解。迭代中利用了梯度上升和半正定投影。距离比较验证了新的包距离函数优于以往的函数。在模型评估中,数值实验表明具有多个视图的 MVML 比单视图条件表现更好,这证明了我们的模型能够有效地整合互补信息,并更精确地度量图像之间的距离。关于参数和实例数量影响的实验验证了该方法的一致性。
引用
@article{arxiv.1610.06671,
title = {Multi-view metric learning for multi-instance image classification},
author = {Dewei Li and Yingjie Tian},
journal= {arXiv preprint arXiv:1610.06671},
year = {2016}
}