通过缓解枢纽问题改进零样本学习
计算与语言
2015-04-16 v3 机器学习
摘要
零样本范式利用无监督方法从文本语料库中提取的基于向量的词表示,学习从其他特征空间到词空间的通用映射函数,其中映射向量的最近邻所关联的词被用作其语言标签。我们发现,映射元素的邻域受到枢纽的严重污染,这些枢纽向量倾向于靠近高比例的数据项,从而将其正确标签挤到邻居列表的下方。在通过实验说明该问题后,我们提出了一种简单的方法来纠正它,即考虑潜在邻居在许多映射向量上的邻近分布。我们证明,这种纠正在跨语言、图像标注和图像检索领域的实际零样本实验中带来了一致的改进。
引用
@article{arxiv.1412.6568,
title = {Improving zero-shot learning by mitigating the hubness problem},
author = {Georgiana Dinu and Angeliki Lazaridou and Marco Baroni},
journal= {arXiv preprint arXiv:1412.6568},
year = {2015}
}