面向开放科学的鲁棒 URL 提取:arXiv 文件格式与时间趋势研究
数字图书馆
2025-09-08 v1
摘要
在这项工作中,我们研究了 URL 提取结果如何依赖于输入格式。我们通过从 10 篇 arXiv 论文中提取 URL 编制了一个试点数据集,并使用相同的启发式方法从源自 PDF 文件或源 LaTeX 文件的四种格式中提取 URL。我们发现,从任何单一格式或多种格式的组合中准确且完整地提取 URL 都具有挑战性,其最佳 F1 分数为 0.71。利用该试点数据集,我们评估了跨格式的提取性能,并表明 HTML 和 XML 等结构化格式比 PDF 或 Text 产生更准确的结果。组合多种格式提高了覆盖率,特别是在针对研究关键资源时。我们进一步将 URL 提取应用于两项任务:即将 URL 分类为开放获取数据集和软件等与其他类别,以及分析 1992 年至 2024 年 arXiv 论文中 URL 使用的趋势。这些结果表明,使用多种格式的组合在 URL 提取上比单一格式取得更好的性能,并且 arXiv 论文中 URL 的数量自 1992 年至 2014 年稳步增加,自 2014 年至 2024 年急剧增加。用于初步分析的数据集和 Jupyter notebooks 已在 https://github.com/lamps-lab/arxiv-urls 上公开提供。
引用
@article{arxiv.2509.04759,
title = {Toward Robust URL Extraction for Open Science: A Study of arXiv File Formats and Temporal Trends},
author = {Rochana R. Obadage and Lamia Salsabil and Sawood Alam and Bipasha Banarjee and William A. Ingram and Edward A. Fox and Jian Wu},
journal= {arXiv preprint arXiv:2509.04759},
year = {2025}
}
备注
Peer reviewed and accepted at WADL 2025, 8 pages, 4 figures