EEMC:嵌入增强的多标签分类方法
机器学习
2020-09-30 v1 计算与语言
机器学习
摘要
近期出现的表示学习在 NLP 与复杂网络中表现优异,正成为机器学习与数据挖掘的基础技术。如何利用表示学习提升分类器性能是一个极具意义的研究方向。我们采用表示学习技术将原始数据(图节点)映射到低维特征空间。在该空间中,每个原始数据获得低维向量表示,我们对这些向量进行简单线性操作以生成虚拟数据,并利用这些向量与虚拟数据训练多标签分类器。随后我们通过 F1 分数(Macro% F1 与 Micro% F1)度量分类器性能。我们的方法使 Macro F1 提升 28%–450%,平均 F1 分数提升 12%–224%。作为对比,我们直接用低维向量训练分类器并度量其性能。我们在三个公开数据集上验证算法,发现虚拟数据极大提升了分类器 F1 分数。因此,我们的算法是提升分类器性能的有效途径。这些结果表明,在表示空间中通过简单线性操作生成的虚拟数据仍保留了原始数据的信息,这对小样本数据集的学习也具重要意义。
引用
@article{arxiv.2009.13826,
title = {EEMC: Embedding Enhanced Multi-tag Classification},
author = {Yanlin Li and Shi An and Ruisheng Zhang},
journal= {arXiv preprint arXiv:2009.13826},
year = {2020}
}