Look Ahead 或 Look Around?自回归与掩码式预训练的理论比较
机器学习
2024-07-02 v1 计算与语言
摘要
近年来,生成式自监督学习(SSL)范式在视觉、语言和多模态领域展现了惊人的性能。尽管不同的SSL目标设计在下游任务中具有不同特性,但这些差异的理论理解仍然基本未被探索。本文在建立理论框架后,首次对两种主要生成式SSL范式——自回归SSL和掩码式SSL——进行理论比较。我们阐明了在分类和内容生成这两类主要评估任务中的自回归和掩码式SSL的优势与局限。我们的发现表明,在分类任务中,掩码式SSL中目标token的灵活位置促进了样本间更密集的连接,而自回归SSL中目标token的固定位置限制了这种连接,从而实现更优的聚类性能。在内容生成任务中,掩码式SSL中未遮盖文本长度固定,而测试样本长度可变的矛盾,阻碍了其生成性能;而自回归SSL中条件文本长度可变,更适合生成任务。为借取两者优势并弥补不足,我们提出了多样性增强的自回归目标和可变长掩码目标,显著提升了自回归SSL的分类性能和掩码式SSL的生成性能。代码已发布于 https://github.com/PKU-ML/LookAheadLookAround。
引用
@article{arxiv.2407.00935,
title = {Look Ahead or Look Around? A Theoretical Comparison Between Autoregressive and Masked Pretraining},
author = {Qi Zhang and Tianqi Du and Haotian Huang and Yifei Wang and Yisen Wang},
journal= {arXiv preprint arXiv:2407.00935},
year = {2024}
}