中文

FewshotQA:一种利用预训练文本到文本模型进行问答任务少样本学习的简单框架

计算与语言 2021-10-13 v3 人工智能 机器学习

摘要

仅从少量样本中学习(称为少样本设置)的任务对真实世界场景具有关键重要性和相关性。对于问答(QA),当前最先进的预训练模型通常需要对上万样本进行微调以获得良好结果。在少样本设置(< 100 样本)下其性能显著下降。为此,我们提出一种简单的微调框架,该框架利用预训练的文本到文本(text-to-text)模型,并与其预训练框架直接对齐。具体而言,我们将输入构造为问题、代表答案跨度的掩码标记(mask token)以及上下文的拼接。给定此输入,模型使用与其预训练目标相同的目标进行微调。通过对各种少样本配置的实验研究,我们表明该公式在多个 QA 基准上带来显著增益(当仅含 16 个训练样本时平均绝对增益为 34.2 个 F1 点)。当使用更大模型时(例如:使用 BART-large 仅 32 个样本在 SQuAD 上达到 72.3 F1)增益进一步扩大,并良好迁移到多语言设置。在多语言 TydiQA 基准上,我们的模型在少样本设置(<= 64 个训练样本)下以最高 40 个 F1 点、平均 33 个 F1 点的绝对优势超越 XLM-Roberta-large。我们进行了详细的消融研究以分析促成这些增益的因素。

关键词

引用

@article{arxiv.2109.01951,
  title  = {FewshotQA: A simple framework for few-shot learning of question answering tasks using pre-trained text-to-text models},
  author = {Rakesh Chada and Pradeep Natarajan},
  journal= {arXiv preprint arXiv:2109.01951},
  year   = {2021}
}

备注

Accepted to EMNLP 2021 Main Conference