中文

理解序列分类中的自预训练

机器学习 2026-05-21 v1

摘要

Amos 等人(2024)表明,Transformer模型在序列分类中可以通过首先以掩码标记预测目标进行预训练,而无需外部数据或数据增强,显著提高准确率,此程序称为自预训练(SPT)。虽然Amos 等人(2024)的主要目标是展示Transformer在长程试验场(LRA)上能够获得强性能,但其管道引出了更多根本性的问题:SPT如何驱动优化以获得更好的解决方案?标准监督训练为何在Transformer中会失败?为更好地理解这一点,我们复制并系统地消除了Amos 等人(2024)的发现。我们的消除实验表明,受研究环境的主要瓶颈不仅仅是深度或泛化,而是标签监督从随机初始化开始学习有用查询-键注意力模式的能力。通过一个最小的设置,我们识别出学习接近性相互作用——将绝对位置编码转化为接近性偏向注意力得分——作为SPT带来的改进的关键来源。最终,在一个简化的理论设置中,我们表明标签监督对某些注意力得分方向是局部盲区,而通过掩码重建则可被检测到。

关键词

引用

@article{arxiv.2605.21070,
  title  = {Towards Understanding Self-Pretraining for Sequence Classification},
  author = {Omar Coser and Loredana Zollo and Paolo Soda and Antonio Orvieto},
  journal= {arXiv preprint arXiv:2605.21070},
  year   = {2026}
}

备注

v1: Preliminary, extension of the version accepted at ICML 2025 Workshop MOSS