PALBERT:教会ALBERT思考
机器学习
2023-05-19 v4 计算与语言
摘要
当前,预训练模型可被视为广泛NLP任务的默认选择。尽管它们取得了SOTA结果,但有实际证据表明,这些模型可能对不同的输入序列需要不同数量的计算层,因为评估所有层会导致对错误预测的过度自信(即过度思考)。这个问题可以通过实施自适应计算时间方法来解决,该方法最初是为提高推理速度而设计的。最近提出的PonderNet可能是一种有前景的解决方案,它通过将退出层的索引视为一个潜在变量来执行提前退出。然而,最初提出的退出准则依赖于从训练好的后验分布中采样,该分布是关于从第层退出的概率,这会在退出层索引中引入较大的方差,显著降低所得模型的性能。在本文中,我们提出用一种新颖的确定性Q-退出准则和重新设计的模型架构来改进PonderNet。我们将所提出的机制适配到ALBERT和RoBERTa,并将其与近期执行提前退出的方法进行了比较。我们观察到,所提出的改动可被视为对原始PonderNet架构的显著改进,并在广泛的GLUE任务上优于PABEE。此外,我们还对所提出的架构进行了深入的消融研究,以进一步理解Lambda层及其性能。
引用
@article{arxiv.2204.03276,
title = {PALBERT: Teaching ALBERT to Ponder},
author = {Nikita Balagansky and Daniil Gavrilov},
journal= {arXiv preprint arXiv:2204.03276},
year = {2023}
}
备注
NeurIPS 2022