波兰语分类任务中少样本学习的评估
计算与语言
2024-04-30 v1
摘要
我们引入了一个由 7 个波兰语原生分类任务组成的少样本基准。我们在 0 样本和 16 样本设置下,使用各种预训练的商业和开源模型,对微调、线性探测、SetFit 和上下文学习(ICL)进行了实证比较。我们的研究结果表明,ICL 取得了最佳性能,其中 GPT-3.5 和 GPT-4 等商业模型表现最优。然而,我们最佳的少样本学习得分与 HerBERT-large(在整个训练数据集上微调)的性能之间仍存在 14 个百分点的显著差距。在这些技术中,SetFit 表现为次优方法,紧随其后的是线性探测。我们观察到非线性头微调的性能最差且最不稳定。ICL 的结果表明,在波兰语语料库上对 Mistral-7b 或 Llama-2-13b 等模型进行持续预训练是有益的。Bielik-7b 和 Trurl-13b 性能的提升分别证实了这一点。为了进一步支持波兰语少样本学习的实验,我们发布了手工制作的 ICL 模板。
引用
@article{arxiv.2404.17832,
title = {Evaluation of Few-Shot Learning for Classification Tasks in the Polish Language},
author = {Tsimur Hadeliya and Dariusz Kajtoch},
journal= {arXiv preprint arXiv:2404.17832},
year = {2024}
}
备注
34 pages, 3 figures, 10 tables