中文

评估在无标签测试数据上进行任务自适应预训练的公平性——面向少样本文本分类

计算与语言 2024-10-03 v2 机器学习

摘要

少样本学习基准测试是评估现代 NLP 技术的关键。然而,基准测试可能偏袒那些容易利用无标签文本的方法,因为研究人员可以利用来自测试集的无标签文本进行预训练。鉴于对这一潜在问题缺乏研究,我们进行实验,量化使用测试集文本进行预训练而非使用独立抽取的无标签文本所导致的偏差。对 25 个分类任务和 3 个语言模型(BERT、GPT-2 和 Mistral 7B)进行受控的少样本和零样本实验未发现显著的过度乐观现象。此外,我们展示了在研究少样本文本分类时进行多次抽样的重要性,并建议少样本学习基准测试包含多个训练折叠。代码和数据已提供:https://github.com/kddubey/pretrain-on-test/

关键词

引用

@article{arxiv.2410.00179,
  title  = {Evaluating the fairness of task-adaptive pretraining on unlabeled test data before few-shot text classification},
  author = {Kush Dubey},
  journal= {arXiv preprint arXiv:2410.00179},
  year   = {2024}
}

备注

To appear in the GenBench Workshop at EMNLP 2024