探究预训练语言模型在跨领域数据集上的表现:迈向通用 AI 的一步
计算与语言
2023-06-22 v1 人工智能
摘要
预训练语言模型近来已成为微调各类语言任务的强力工具。理想情况下,当模型在大量数据上预训练时,预期其能获得隐式知识。本文中,我们探究预训练语言模型泛化至不同非语言任务的能力。具体而言,我们在来自不同领域的任务上测试它们,如计算机视觉、层次数据推理与蛋白质折叠预测。我们所用的四个预训练模型 T5、BART、BERT 与 GPT-2 取得了出色结果。它们性能相近,且大幅优于从头训练的 transformer。例如,预训练语言模型在 Listops 数据集上表现更优,平均准确率为 58.7%,而从头训练的 transformer 平均准确率为 29.0%。在三类数据集上展现的显著提升表明,语言上的预训练有助于模型获取通用知识,使我们离通用 AI 更近一步。我们还展示了减少预训练语言模型参数量影响不大,因为使用 T5-Small 替代 T5-Base 时性能仅轻微下降。事实上,仅使用 2% 的参数,相较于从头训练便实现了巨大提升。最后,与先前工作相反,我们发现使用预训练嵌入作为输入层对于取得预期结果是必要的。
引用
@article{arxiv.2306.12205,
title = {Investigating Pre-trained Language Models on Cross-Domain Datasets, a Step Closer to General AI},
author = {Mohamad Ballout and Ulf Krumnack and Gunther Heidemann and Kai-Uwe Kühnberger},
journal= {arXiv preprint arXiv:2306.12205},
year = {2023}
}