中文

科学论文大型单主题语料的互动式精馏

信息检索 2023-09-20 v1 计算与语言 数字图书馆 机器学习

摘要

高度专门化的科学文献数据集对研究与教育都十分重要。然而,大规模构建此类数据集十分困难。一种常见方法是还原式地构建这些数据集:在已有语料上应用主题建模并选取特定主题。一种更稳健但耗时的方法是建构式地构建数据集,即由领域专家(SME)人工挑选文档。随着数据集增大,该方法无法扩展且易出错。在此我们展示一种基于机器学习的新工具,用于建构式地生成科学文献的目标数据集。给定一小部分初始“核心”论文语料,我们构建文档的引文网络。在引文网络的每一步,我们生成文本嵌入并通过降维可视化这些嵌入。若论文与核心语料“相似”则保留在数据集中,否则通过人在回路(human-in-the-loop)筛选予以剪除。借助 SeNMFk 进行子主题建模可进一步获得对论文的深入洞察。我们将该新工具应用于机器学习中两个不同领域的文献综述以作演示。

关键词

引用

@article{arxiv.2309.10772,
  title  = {Interactive Distillation of Large Single-Topic Corpora of Scientific Papers},
  author = {Nicholas Solovyev and Ryan Barron and Manish Bhattarai and Maksim E. Eren and Kim O. Rasmussen and Boian S. Alexandrov},
  journal= {arXiv preprint arXiv:2309.10772},
  year   = {2023}
}

备注

Accepted at 2023 IEEE ICMLA conference