中文

面向低资源任务的 KL 正则化归一化框架

计算与语言 2022-12-23 v1 人工智能 机器学习

摘要

大型预训练模型,如 Bert、GPT 和 Wav2Vec,已经展现出学习可迁移至各种下游任务的表示的巨大潜力。由于资源和时间的有限可用性,难以获取大量监督数据。有鉴于此,在低资源设置下通过微调、线性探测或提示微调将大型预训练数据集用于各种下游任务的领域已进行了大量研究。归一化技术对于加速训练和提高深度神经网络的泛化能力至关重要,并已成功应用于各种应用中。已有许多归一化技术被提出,但归一化在低资源下游 NLP 和语音任务中的成功仍然有限。原因之一是归一化的缩放参数无法捕捉表达能力。我们提出了 Kullback-Leibler (KL) 正则化归一化 (KL-Norm),它使归一化后的数据表现良好并有助于更好的泛化,因为它减少了过拟合,在域外分布上泛化良好,并以可忽略的模型参数和内存开销增加消除了不相关的偏差和特征。在多个低资源 NLP 和语音任务上的详细实验评估表明,与其他流行的归一化和正则化技术相比,KL-Norm 具有优越的性能。

关键词

引用

@article{arxiv.2212.11275,
  title  = {KL Regularized Normalization Framework for Low Resource Tasks},
  author = {Neeraj Kumar and Ankur Narang and Brejesh Lall},
  journal= {arXiv preprint arXiv:2212.11275},
  year   = {2022}
}

备注

arXiv admin note: text overlap with arXiv:2106.05469 by other authors