中文

面向学术大数据集记录链接的噪声与异构元数据清洗

数字图书馆 2019-06-21 v1 信息检索

摘要

从 PDF 格式学术文档中自动抽取的元数据通常含有噪声且异构,常包含不完整的字段和错误的值。清洗元数据的常用方法是利用文献参考数据集。挑战在于以高精度跨语料匹配记录。现有的基于信息检索和题名字符串相似度的方案仅在题名被清洗后效果良好。我们介绍一个旨在将带噪声元数据的学术文档实体与参考数据集匹配的系统。分块函数使用经典 BM25 算法从已由 ElasticSearch 索引的参考数据中查找匹配候选。核心组件使用有监督方法,结合从所有可用元数据字段提取的特征。该系统还利用可用的引文信息来匹配实体。元数据与引文的组合达到了高准确率,在相同测试集上显著优于基线方法。我们将该系统应用于匹配 CiteSeerX 数据库与 Web of Science、PubMed 和 DBLP。该方法将部署于 CiteSeerX 系统以清洗元数据并链接到其他学术大数据集的记录。

关键词

引用

@article{arxiv.1906.08470,
  title  = {Cleaning Noisy and Heterogeneous Metadata for Record Linking Across Scholarly Big Datasets},
  author = {Athar Sefid and Jian Wu and Allen C. Ge and Jing Zhao and Lu Liu and Cornelia Caragea and Prasenjit Mitra and C. Lee Giles},
  journal= {arXiv preprint arXiv:1906.08470},
  year   = {2019}
}