中文

多媒体信息检索的机器学习方法

计算机视觉与模式识别 2017-05-16 v1

摘要

在本论文中,我们考察了若干多模态特征提取与学习方法,用于检索与分类。我们在第2节简要重读了学习的某些理论结果,在第3节回顾了若干生成式与判别式模型,并在第4节描述了相似核。我们在第5节考察了多模态图像检索与分类的不同方面,并在第6节提出了识别 Web 文档质量评估的方法。在最后一个问题中,我们提出了基于时间序列分类的相似核。实验在公开可用数据集上进行,最关键部分的源代码或是开源的或是已发布的。由于所使用的相似图(第4.2节)出于计算目的受到极大限制,我们希望继续研究更复杂、演化且能力更强的图,并应用于不同问题,例如捕捉分布中的快速变化(如基于会话的推荐)或文献工作的复杂图。带有适当度量的相似核达到了并且在许多情况下超越了当前最优(state-of-the-art)水平。因此我们可以得出结论:基于多模态实例相似性的生成模型是一种普遍适用的模型,可用于跨多个领域的分类与回归任务,包括但不限于本论文中提出的那些。更一般地,Fisher kernel 不仅在许多方面独特,而且是最强大的核函数之一。因此未来我们可能在广泛使用的生成模型上利用 Fisher kernel,例如 Boltzmann Machines [Hinton et al., 1984]、其特定子集受限 Boltzmann 机与深度信念网络 [Hinton et al., 2006]、Latent Dirichlet Allocation [Blei et al., 2003] 或隐马尔可夫模型 [Baum and Petrie, 1966] 等等。

关键词

引用

@article{arxiv.1705.04964,
  title  = {Machine learning methods for multimedia information retrieval},
  author = {Bálint Zoltán Daróczy},
  journal= {arXiv preprint arXiv:1705.04964},
  year   = {2017}
}

备注

doctoral thesis, 2016