中文

三元组与知识注入嵌入:科学文献的聚类与分类

计算与语言 2026-04-21 v2 人工智能 数字图书馆

摘要

科学文献的volume与复杂度日益增加,亟需稳健的方法进行组织与理解。本研究考量了结构化知识——具体而言是主谓宾三元组——是否能提升科学论文的聚类与分类。我们构建了一个模块化管道,组合无监督聚类与监督分类,涵盖四种文档表示:摘要、三元组、摘要+三元组以及混合表示。我们采用筛选后的 arXiv 语料库,评估了 MiniLM、MPNet、SciBERT、SPECTER 四种 transformer 嵌入模型,分别使用 KMeans、GMM 和 HDBSCAN 进行聚类,随后训练下游分类器进行主题预测。在五次随机种子(种子 40-44)的基准测试中,仅使用摘要的输入提供了最强且最稳定的分类性能,达到 0.923 的准确率和 0.923 的宏 F1 分数。仅使用三元组或知识注入变体未能稳健地超越这一基准。在聚类任务中,KMeans/GMM 在外部有效性指标上通常优于 HDBSCAN,而 HDBSCAN 在噪声敏感性方面表现更佳。我们观察到,简单地添加提取的三元组并不必然带来性能提升,具体取决于表示选择,甚至可能降低性能。这些结果细化了知识注入在科学文献建模中的作用:结构化三元组虽具信息量,但并非在所有情况下都有益,其影响强烈取决于配置选择。我们的发现提供了可复现的基准测试,并为何时选择知识增强表示、何时依赖强大的文本-only 基准提供了实用指导。

关键词

引用

@article{arxiv.2601.08841,
  title  = {Triples and Knowledge-Infused Embeddings for Clustering and Classification of Scientific Documents},
  author = {Mihael Arcan},
  journal= {arXiv preprint arXiv:2601.08841},
  year   = {2026}
}