透视 arXiv:对 arXiv 投稿源文件的大规模分析
网络与互联网体系结构
2026-01-19 v1
摘要
arXiv 是最大的科学文献开放获取存储库。在提交论文时,作者上传手稿的源文件,最终 PDF 由其编译而成。这些源文件也是公开可下载的,这可能会暴露与已发表论文无关的数据——例如图片、文档或注释——这些数据可能无意中泄露机密信息或仅仅是浪费存储空间。因此我们自问:“在 arXiv 投稿的源文件中能发现什么?”我们对 2015 年至 2025 年间出现在 arXiv 上的约 600,000 份投稿进行了纵向分析。对于每份投稿,我们检查上传的源文件,以量化和表征生成相应 PDF 所不需要的数据。平均而言,每份投稿中有 27% 的数据是不必要的,在我们的整个数据集中总计超过 580 GB 的冗余内容。定性检查揭示了具有攻击性/不当文本(例如,“WTF does this mean?”)的存在,以及可能披露正在进行的研究的实验细节。我们已联系 arXiv 的领导团队以及受影响论文的作者,以提醒他们注意这些问题。最后,我们提出了建议以及一种自动化工具,用于大规模检测和分析 arXiv 投稿中的残留数据,旨在改善 arXiv 生态系统中的数据卫生。
引用
@article{arxiv.2601.11385,
title = {X-raying the arXiv: A Large-Scale Analysis of arXiv Submissions' Source Files},
author = {Giovanni Apruzzese and Aurore Fass},
journal= {arXiv preprint arXiv:2601.11385},
year = {2026}
}