中文

数据核视角空间对 Transformer 模型生成合成数据的性能保证

计算与语言 2026-02-06 v1 机器学习 机器学习

摘要

标注训练数据的稀缺性仍是构建高性能语言技术和生成式 AI 模型的最大瓶颈。 Transformer 模型——尤其是大语言模型(LLM)——正日益被用于通过合成数据生成来缓解数据稀缺问题。然而,由于模型是黑箱,合成数据的性质难以预测。在实际操作中,语言技术工程师常常通过调节 LLM 温度 setting 并盲目期待另一端输出能改善下游模型的效果。面对这种不确定性,本文提出数据核视角空间(Data Kernel Perspective Space, DKPS),以提供数学分析的基础,为 Transformer 模型输出质量提供具体的统计保证。我们首先展示 DKPS 的数学推导及其如何提供性能保证。随后展示 DKPS 性能保证如何阐明下游任务(如神经机器翻译模型或使用对比偏好优化(Contrastive Preference Optimization, CPO)训练的 LLM)的性能。也讨论了当前工作的局限性及未来研究方向。

关键词

引用

@article{arxiv.2602.05106,
  title  = {Data Kernel Perspective Space Performance Guarantees for Synthetic Data from Transformer Models},
  author = {Michael Browder and Kevin Duh and J. David Harris and Vince Lyzinski and Paul McNamee and Youngser Park and Carey E. Priebe and Peter Viechnicki},
  journal= {arXiv preprint arXiv:2602.05106},
  year   = {2026}
}