中文

ACTNET:用于高效实例图像检索的特征激活与多流聚合端到端学习

计算机视觉与模式识别 2020-10-26 v3

摘要

我们提出了一种称为 ACTNET 的新型 CNN 架构,用于从大规模数据集中进行鲁棒实例图像检索。我们的关键创新是一个可学习的激活层,旨在提高深度卷积特征图的信噪比(SNR)。此外,我们引入了受控的多流聚合,其中来自不同卷积层的互补深度特征在使用我们的新型激活层进行最优变换和平衡后,聚合成一个全局描述符。重要的是,我们激活块的可学习参数与 CNN 参数一起以端到端方式显式训练,最小化三元组损失。这意味着我们的网络联合学习 CNN 滤波器及其针对检索任务的最优激活与聚合。据我们所知,这是首次使用参数化函数来控制并学习最优聚合。我们对三种非线性激活函数进行了深入实验研究:双曲正弦(Sine-Hyperbolic)、指数(Exponential)和改进威布尔(Weibull),表明虽然三者均带来显著增益,但威布尔函数因能均衡强激活而表现最佳。结果清晰表明,我们的 ACTNET 架构显著增强了深度特征的判别力,在所有数据集上均大幅优于当前最优(SOTA)检索结果。

关键词

引用

@article{arxiv.1907.05794,
  title  = {ACTNET: end-to-end learning of feature activations and multi-stream aggregation for effective instance image retrieval},
  author = {Syed Sameed Husain and Eng-Jon Ong and Miroslaw Bober},
  journal= {arXiv preprint arXiv:1907.05794},
  year   = {2020}
}