中文

基于序列到序列深度神经网络与记忆网络的 k 近邻

机器学习 2019-11-28 v4 人工智能 机器学习

摘要

k 近邻是最基本但有效的分类模型之一。在本文中,我们提出了基于序列到序列模型和记忆网络模型构建的两个模型族来模拟 k 近邻模型,它们生成一个标签序列、一个样本外特征向量序列以及用于分类的最终标签,因此它们也可以用作过采样器。我们还提出了模型的“核外”版本,该版本假设只有一小部分数据可以加载到内存中。计算实验表明,由于我们的模型必须产生额外的输出而不仅仅是标签,我们的模型在结构化数据集上优于 k 近邻、前馈神经网络、XGBoost、lightGBM、随机森林和记忆网络。在图像和文本数据集上,我们模型的性能接近许多 SOTA 深度模型。作为不平衡数据集上的过采样器,序列到序列 kNN 模型通常优于合成少数类过采样技术和自适应合成采样。

关键词

引用

@article{arxiv.1804.11214,
  title  = {k-Nearest Neighbors by Means of Sequence to Sequence Deep Neural Networks and Memory Networks},
  author = {Yiming Xu and Diego Klabjan},
  journal= {arXiv preprint arXiv:1804.11214},
  year   = {2019}
}