ALERT:使语言模型适应推理任务
计算与语言
2023-10-02 v2
摘要
当前大语言模型在需要逐步推理的复杂任务上,通过少样本学习可取得相当好的表现。这些模型是在预训练期间习得了推理技能并在训练上下文之外进行推理,还是仅仅以更细粒度记忆其训练语料并学会了更好地理解其上下文?为区分这些可能性,我们引入 ALERT,一个用于评估语言模型推理能力的基准与分析套件,比较预训练与微调模型在需要推理技能解决的复杂任务上的表现。ALERT 提供了一个测试平台,可在细粒度推理技能上评估任意语言模型,其涵盖超过 20 个数据集与 10 种不同推理技能。我们利用 ALERT 进一步研究微调的作用。通过大量实证分析,我们发现语言模型在微调阶段相比预训练状态习得了更多推理技能,如文本蕴涵、溯因推理与类比推理。我们还发现,当语言模型被微调时,它们倾向于过拟合提示模板,这损害了模型的鲁棒性并导致泛化问题。
引用
@article{arxiv.2212.08286,
title = {ALERT: Adapting Language Models to Reasoning Tasks},
author = {Ping Yu and Tianlu Wang and Olga Golovneva and Badr AlKhamissi and Siddharth Verma and Zhijing Jin and Gargi Ghosh and Mona Diab and Asli Celikyilmaz},
journal= {arXiv preprint arXiv:2212.08286},
year = {2023}
}