中文

NLP 预训练与微调的学习机制

核理论 2025-09-04 v1

摘要

自然语言处理(NLP)通过在大数据集上对复杂架构进行预训练来学习语言,随后对权重进行微调以实现特定任务。我们检验了两个目标:理解成功预训练背后的机制,以及预训练准确率与分类任务的微调之间的相互作用。获得的主要结果包括:每个标记的准确率(APT)随其在数据集中的出现频率而增加,其平均值作为衡量预训练成功的序参量,沿着Transformer块逐层增加。预训练打破了标记之间的对称性,将其分组为有限的、小的、强匹配标记簇,如由所呈现的标记混淆矩阵所推断。这种特征在Transformer块向输出层的过程中被加强,显著提升了其性能,尤其与嵌入层相比。因此,尽管学习成本函数仅针对识别单个标记,预训练仍生成更高阶语言结构。这些预训练发现反映在微调准确率的提高上,沿着Transformer块逐层提升。此外,发现输出标签预测置信度与平均输入APT无关,因为输入意义自标记被主要替换为强匹配标记后得以保留。最后,尽管预训练在图像分类任务中常见,却在微调NLP分类任务中使用,其底层机制相似,暗示其普遍性。本研究基于在维基百科数据集上预训练并在 FewRel 和 DBpedia 分类任务上微调的 BERT-6 架构得出。

关键词

引用

@article{arxiv.2509.03406,
  title  = {Bayesian analysis of properties of nuclear matter with the FOPI experimental data},
  author = {Guojun Wei and Manzi Nan and Pengcheng Li and Yongjia Wang and Qingfeng Li and Gaochan Yong and Fuhu Liu},
  journal= {arXiv preprint arXiv:2509.03406},
  year   = {2025}
}

备注

10 pages, 7 figures