中文

基于对比学习的科学文章句子级嵌入的分类与聚类

计算与语言 2024-04-02 v1

摘要

科学文章是长文本文档,组织成章节,每个章节描述研究的各个方面。由于可用文章数量的增加,分析科学产出变得越来越具有挑战性。在此背景下,我们的方法包括微调Transformer语言模型,以从科学文章生成句子级嵌入,考虑以下标签:背景、目标、方法、结果和结论。我们在三个数据集上使用对比学习训练模型。两个数据集来自计算机科学和医学领域的文章摘要。此外,我们引入了PMC-Sents-FULL,一个从医学文章全文提取句子的新数据集。我们比较了微调模型和基线模型在聚类和分类任务中的表现,以评估我们的方法。平均而言,聚类一致性度量值提高了五倍。对于分类度量,在最佳情况下,F1-micro平均提高了30.73%。结果表明,使用对比学习微调句子Transformer并将生成的嵌入用于下游任务是科学文章句子分类的可行方法。我们的实验代码可在GitHub上获取。

关键词

引用

@article{arxiv.2404.00224,
  title  = {Classification and Clustering of Sentence-Level Embeddings of Scientific Articles Generated by Contrastive Learning},
  author = {Gustavo Bartz Guedes and Ana Estela Antunes da Silva},
  journal= {arXiv preprint arXiv:2404.00224},
  year   = {2024}
}