数据轨迹追踪:关于大语言模型数据源、透明性与可追溯性的综述
密码学与安全
2026-01-22 v1 人工智能
机器学习
摘要
大语言模型(LLM)已大规模部署,但其训练数据的生命周期仍然不透明。本综述综合了过去十年关于三个紧密耦合轴向的研究:(1)数据源 provenance,(2)透明性,(3)可追溯性,以及三个支撑支柱:(4)偏见与不确定性,(5)数据隐私,(6) operationalize 这些支柱的工具与技术。核心贡献是提出一种定义该领域领域及其对应制品的 taxonomy。通过分析 95 篇文献,本工作确定关于数据生成、watermarking、偏差测量、数据 curation、数据隐私以及透明性与隐蔽性之间的内在权衡的关键方法。
关键词
引用
@article{arxiv.2601.14311,
title = {Tracing the Data Trail: A Survey of Data Provenance, Transparency and Traceability in LLMs},
author = {Richard Hohensinner and Belgin Mutlu and Inti Gabriel Mendoza Estrada and Matej Vukovic and Simone Kopeinik and Roman Kern},
journal= {arXiv preprint arXiv:2601.14311},
year = {2026}
}
备注
35 pages, 6 figures. Manuscript submitted to ACM Computing Surveys (CSUR) on the 12th of December 2025