基于典型视图的离散多模态哈希用于鲁棒移动地标搜索
计算机视觉与模式识别
2017-07-14 v1
摘要
移动地标搜索(MLS)因其巨大的实用价值近来受到越来越多的关注。然而,由于两个重要挑战,它仍未得到解决。其一是查询传输的高带宽消耗,其二是来自移动设备的查询图像的巨大视觉变化。在本文中,我们提出一种新颖的哈希方案,命名为基于典型视图的离散多模态哈希(CV-DMH),通过一种新颖的三阶段学习过程来处理这些问题。首先,设计了一个子模函数以度量视图集的视觉代表性与冗余度。借此,能够以有限冗余捕捉地标关键视觉外观的典型视图,通过迭代挖掘策略被高效发现。其次,应用多模态稀疏编码将来自多个模态的视觉特征转换为中间表示。它能以特定典型视图鲁棒且自适应地刻画不同地标图像的视觉内容。最后,在定制离散二值嵌入模型上于中间表示学习紧凑二值码,该模型保留以典型视图度量的图像视觉关系并去除所涉噪声。在此部分,我们开发了一种新的基于增广拉格朗日乘子(ALM)的优化方法,直接求解离散二值码。我们不仅能显式处理离散约束,还能同时考虑比特不相关约束与平衡约束。在真实世界地标数据集上的实验证明了CV-DMH优于几种最先进方法的性能。
引用
@article{arxiv.1707.04047,
title = {Discrete Multi-modal Hashing with Canonical Views for Robust Mobile Landmark Search},
author = {Lei Zhu and Zi Huang and Xiaobai Liu and Xiangnan He and Jingkuan Song and Xiaofang Zhou},
journal= {arXiv preprint arXiv:1707.04047},
year = {2017}
}