arXiv 文档、章节与摘要的分类与聚类:自然语言与数学语言编码的比较
数字图书馆
2020-05-25 v1 计算与语言
信息检索
机器学习
摘要
在本文中,我们展示了如何选择并组合自然语言与数学语言的编码,并影响其带有数学内容的文档的分类与聚类。为此,我们使用来自 arXiv 预印本服务器的文档、章节和摘要集合,这些集合按其学科类别(数学、计算机科学、物理学等)标注,以比较文本与公式的不同编码,并评估所选分类与聚类算法的性能和运行时间。我们的编码在分类准确率上最高达到 ,在聚类纯度上分别最高达到 (簇数等于类别数)和 (未指定簇数)。我们观察到文本相似度与数学相似度之间的相关性相对较低,这表明文本与公式是独立的,并促使将它们视为文档的分离特征。该分类与聚类可用于例如文档检索与推荐。此外,我们展示了在计算机对文档进行分类时优于人类专家。最后,我们评估并讨论了多标签分类与公式语义化。
引用
@article{arxiv.2005.11021,
title = {Classification and Clustering of arXiv Documents, Sections, and Abstracts, Comparing Encodings of Natural and Mathematical Language},
author = {Philipp Scharpf and Moritz Schubotz and Abdou Youssef and Felix Hamborg and Norman Meuschke and Bela Gipp},
journal= {arXiv preprint arXiv:2005.11021},
year = {2020}
}