中文

你被 LaTeXpOsEd 了:使用大型语言模型分析 preprint 存档中信息泄露的系统性研究

密码学与安全 2026-05-12 v2 人工智能

摘要

preprint 存储库如 arXiv 的广泛使用已加速了科学结果的传播,但也引入了被忽视的安全风险。除了 PDF 之外,这些平台提供对原始材料(包括 LaTeX 源文件、辅助代码、图形和嵌入注释)的无限制访问。在缺乏消毒的情况下,提交内容可能披露敏感信息,供对手使用开源情报技术进行收集。本文我们首次对 preprint 存档进行大规模安全审计,分析超过 1.2 TB 来自 10 万个 arXiv 提交材料的源数据。我们引入 LaTeXpOsEd,一个四阶段框架,将模式匹配、逻辑过滤、传统收集技术和大型语言模型(LLM)集成,用于揭示非引用文件和 LaTeX 注释中隐藏的披露。为评估 LLM 的秘密检测能力,我们引入 LLMSec-DB 基准测试,并对 25 个最先进模型进行测试。我们的分析发现了数千处个人信息泄露、GPS 标记的 EXIF 文件、公开可用的 Google Drive 和 Dropbox 文件夹、可编辑的私有 SharePoint 链接、暴露的 GitHub 和 Google 凭证,以及云 API 密钥。我们还发现了机密作者通信、内部分歧以及会议提交凭证,暴露了对研究人员和机构构成严重声誉风险的信息。我们呼吁研究社区和存储库运营商立即采取行动关闭这些隐藏的安全漏洞。为支持开放科学,我们发布了本研究的所有脚本和方法,但暂不披露可能被滥用的敏感发现,遵循伦理原则。源代码及相关材料可在项目网站 https://github.com/LaTeXpOsEd 提供。

关键词

引用

@article{arxiv.2510.03761,
  title  = {You Have Been LaTeXpOsEd: A Systematic Analysis of Information Leakage in Preprint Archives Using Large Language Models},
  author = {Richard A. Dubniczky and Bertalan Borsos and Tamas Bisztray and Norbert Tihanyi},
  journal= {arXiv preprint arXiv:2510.03761},
  year   = {2026}
}