中文

基于退火软最近邻损失的文本分类与聚类

机器学习 2021-08-02 v1 计算与语言 神经与进化计算

摘要

我们将解耦定义为类间数据点的相互距离相对于类内数据点间距离的大小。在表示学习过程中最大化解耦时,我们获得一个变换后的特征表示,其中数据点的类属关系得以保持。若数据点的类属关系得以保持,我们将拥有一个特征表示空间,其中最近邻分类器或聚类算法能表现良好。我们利用该方法学习更好的自然语言表示,并将其应用于文本分类与文本聚类任务。通过解耦,我们获得了具有更清晰聚类的文本表示,并提升了文本分类性能。我们的方法在 AG News 数据集上取得了高达 90.11% 的测试分类准确率和 88% 的测试聚类准确率,优于我们的基线模型——且未使用任何其他训练技巧或正则化。

关键词

引用

@article{arxiv.2107.14597,
  title  = {Text Classification and Clustering with Annealing Soft Nearest Neighbor Loss},
  author = {Abien Fred Agarap},
  journal= {arXiv preprint arXiv:2107.14597},
  year   = {2021}
}