中文

LLMSurgeon:诊断大语言模型的数据混合

计算与语言 2026-05-29 v1 人工智能 机器学习

摘要

大语言模型(LLM)的预训练数据混合构成其“数字 DNA”,塑造模型的行为、能力及失效模式。然而,这种组成几乎不被披露,使得事后审计数据组合或来源困难。本文我们形式化了“数据混合手术(Data Mixture Surgery, DMS)”:仅凭目标 LLM 生成的文本,估计其预训练语料库在给定分类法下的域级分布。我们提出了“LLMSurgeon”,是一个强大的框架,将 DMS 视为标签迁移假设下的逆问题。与直接聚合分类器输出不同,LLMSurgeon 估计一个已校准的软混淆矩阵,并求解受约束的逆问题,以纠正系统性的域混淆并恢复潜在混合先验。为评估,我们引入“LLMScan”,一个基于开源 LLM 构建的、配方可验证的评估套件,这些 LLM 拥有透明的预训练混合。通过 LLMScan,LLMSurgeon 在固定协议下高保真地恢复域混合。我们的工作提出了一种实用的事后方法,用于在不访问训练数据的情况下审计基础模型的数字 DNA。

关键词

引用

@article{arxiv.2605.30348,
  title  = {LLMSurgeon: Diagnosing Data Mixture of Large Language Models},
  author = {Yaxin Luo and Jiacheng Cui and Xiaohan Zhao and Xinyi Shang and Jiacheng Liu and Xinyue Bi and Zhaoyi Li and Zhiqiang Shen},
  journal= {arXiv preprint arXiv:2605.30348},
  year   = {2026}
}

备注

ACL 2026 Main. Code at https://github.com/Yaxin9Luo/LLMSurgeon