中文

关于大语言模型的数据-参数对应关系:一项初步探讨

机器学习 2026-04-21 v1

摘要

大型语言模型的优化历史上分为数据中心和模型中心两个孤立的范式:前者通过选择、增强或投毒来操作涉及的样本,后者通过掩码、量化或低秩适应来调优模型权重。本文建立了一个统一的数据-参数对应关系,揭示这些看似迥异的操作作为统计流形 M\mathcal{M} 上的几何结构的二元化 manifestation。基于Fisher-Rao度量 gij(θ)g_{ij}(\theta) 和自然参数 (θ\theta) 与期望参数 (η\eta) 之间的Legendre二次性,我们识别出三个基本对应关系贯穿整个模型生命周期:1. 几何对应:数据修剪和参数稀疏化等价地通过双坐标约束减少流形体积;2. 低秩对应:通过归纳学习(ICL)和LoRA适应在Grassmannian G(r,d)\mathcal{G}(r,d) 上探索相同的子空间,kk shot样本在几何上等价于秩-rr 更新;3. 安全隐私对应:对抗性攻击在数据投毒和参数后门之间 exhibits cooperative放大,而保护机制遵循级联衰减,其中数据压缩在乘上方式增强参数隐私。该框架从训练通过后训练压缩到推理,提供了跨社区方法转移的数学形式化,表明将数据和参数模态集成的合作优化可能在效率、鲁棒性和隐私维度上超过孤立方法。

关键词

引用

@article{arxiv.2604.17384,
  title  = {Towards a Data-Parameter Correspondence for LLMs: A Preliminary Discussion},
  author = {Ou Wu},
  journal= {arXiv preprint arXiv:2604.17384},
  year   = {2026}
}

备注

25 pages