中文

通过模型组合与 R-CCA 方法实现语言与视觉的有效结合

计算与语言 2016-10-05 v2

摘要

我们探讨在用于词义表示的向量空间模型中整合文本与视觉信息的问题。我们首先提出残差典型相关分析(R-CCA)方法,该方法通过为每个模态表示原始信号与投影到共享的最大相关空间中的信号之差,来补充标准 CCA 方法。随后我们证明,构建视觉与文本表示,然后通过组合常见的建模基元(如 PCA、CCA、R-CCA 和线性插值,即序列建模)对其进行后处理,能够产生高质量的模型。在五个标准语义基准上,我们的序列模型优于近期的多模态表示学习替代方案,包括依赖联合表示学习的方案。在其中两个基准上,我们的 R-CCA 方法是我们算法产生的最佳配置的一部分。

关键词

引用

@article{arxiv.1609.08810,
  title  = {Effective Combination of Language and Vision Through Model Composition and the R-CCA Method},
  author = {Hagar Loeub and Roi Reichart},
  journal= {arXiv preprint arXiv:1609.08810},
  year   = {2016}
}

备注

6 pages, 1 figure