切勿从零训练:长序列模型的公平比较需要数据驱动的先验
机器学习
2024-04-30 v4 计算与语言
摘要
对序列长程依赖建模是机器学习中的长期目标,并催生了诸如状态空间模型等架构,其在长序列上大幅优于 Transformer。然而,这些令人印象深刻的经验增益很大程度上是在基准(如 Long Range Arena)上展示的,其中模型被随机初始化并训练以从输入序列预测目标标签。本工作中,我们表明随机初始化导致对架构间差异的严重高估,而使用仅下游任务数据、以标准去噪目标进行预训练,可在多种架构上带来显著提升,并使 Transformer 与状态空间模型(SSM)之间的差距变得极小。与先前工作截然相反,我们发现经恰当预训练的普通 Transformer 在 Long Range Arena 上可匹敌 S4 的性能,并将 SSM 在 PathX-256 任务上的最佳报告结果提高了 20 个绝对百分点。随后,我们分析了先前提出的 SSM 结构化参数化的效用,表明在通过预训练获得数据驱动初始化后,它们大多变得冗余。我们的工作表明,在监督任务上评估不同架构时,通过预训练引入数据驱动先验对于可靠的性能估计至关重要,且可高效完成。
引用
@article{arxiv.2310.02980,
title = {Never Train from Scratch: Fair Comparison of Long-Sequence Models Requires Data-Driven Priors},
author = {Ido Amos and Jonathan Berant and Ankit Gupta},
journal= {arXiv preprint arXiv:2310.02980},
year = {2024}
}