中文

基于提示的模型是否茫然无知?

计算与语言 2022-05-23 v2

摘要

使用任务特定头微调大型预训练语言模型,已在许多自然语言理解基准上推进了最优水平。然而,带任务特定头的模型需要大量训练数据,使其易于学习并利用特定数据集的表层线索,而这些线索无法泛化到其他数据集。提示方法通过复用语言模型头并将任务输入格式化为匹配预训练目标,降低了对数据的需求。因此,人们预期少样本基于提示的模型不会利用表层线索。本文对少样本基于提示的模型是否同样利用表层线索进行了实证考察。在 MNLI、SNLI、HANS 和 COPA 上分析少样本基于提示的模型,揭示出基于提示的模型同样利用表层线索。尽管这些模型在含表层线索的样本上表现良好,但在不含表层线索的样本上往往表现不佳,或仅勉强优于随机准确率。

关键词

引用

@article{arxiv.2205.09295,
  title  = {Are Prompt-based Models Clueless?},
  author = {Pride Kavumba and Ryo Takahashi and Yusuke Oda},
  journal= {arXiv preprint arXiv:2205.09295},
  year   = {2022}
}