中文

NERdME:用于代码仓库中研究文献索引的命名实体识别数据集

计算与语言 2026-03-09 v1

摘要

现有的学术信息抽取数据集专注于科学论文,忽略了代码仓库中实现层面的细节。README 文件描述了数据集、源代码及其他实现层面的文献,然而其自由形式的 Markdown 格式缺乏语义结构,导致自动信息抽取困难。为填补这一空白,本文介绍了 NERdME:一个包含 200 个手动标注的 README 文件,涉及超过 10,000 个标记片段和 10 种实体类型。使用大型语言模型和微调的变换模型进行基线实验,显示出论文层面与实现层面实体之间的显著差异,表明将实体类型纳入 SIE 基准测试的价值。还进行了下游实体链接实验,以演示从 README 中提取的实体可支持文献发现和元数据集成。

关键词

引用

@article{arxiv.2603.05750,
  title  = {NERdME: a Named Entity Recognition Dataset for Indexing Research Artifacts in Code Repositories},
  author = {Genet Asefa Gesese and Zongxiong Chen and Shufan Jiang and Mary Ann Tan and Zhaotai Liu and Sonja Schimmler and Harald Sack},
  journal= {arXiv preprint arXiv:2603.05750},
  year   = {2026}
}

备注

To be published (Accepted at WWW'26)