判别性跨视图二值表示学习
计算机视觉与模式识别
2018-04-05 v1
摘要
学习紧凑表示对于大规模多媒体数据至关重要且具有挑战性。随着多媒体内容的指数级增长,用于有效二值表示学习的跨视图/跨模态哈希受到了显著关注。现有多数跨视图哈希算法强调各视图内部的相似性,再通过跨视图相似性将其关联。本工作中,我们专注于从不同视图中挖掘判别性信息,并提出一种端到端方法,以学习保持语义且具判别性的二值表示,称为判别性跨视图哈希(DCVH),用于为跨视图检索、图像到图像检索以及图像标注/标记等任务学习多任务二值表示。所提DCVH具有以下关键组件。首先,它同时使用基于卷积神经网络(CNN)的非线性哈希函数和多标签分类来处理图像与文本。此类哈希函数通过使用直接二值嵌入(DBE)层,在训练中实现有效的连续松弛而无需显式量化损失。其次,我们提出通过汉明距离最小化实现有效的视图对齐,该过程借助按位异或操作高效完成。在两个图文基准数据集上的大量实验表明,DCVH优于最先进的跨视图哈希算法以及单视图图像哈希算法。此外,DCVH在图像标注/标记上也能提供有竞争力的性能。
引用
@article{arxiv.1804.01233,
title = {Discriminative Cross-View Binary Representation Learning},
author = {Liu Liu and Hairong Qi},
journal= {arXiv preprint arXiv:1804.01233},
year = {2018}
}
备注
Published in WACV2018. Code will be available soon