中文

零样本设定下跨多项选择任务的提示评估

计算与语言 2022-03-30 v1 人工智能 机器学习

摘要

大语言模型已显示出通过自然语言提示可实现令人印象深刻的零样本性能(Radford et al., 2019; Brown et al., 2020; Sanh et al., 2021)。然而,创建有效的提示需要大量的试错。这引出了一个问题:提示的哪些特性会影响其性能?为此,我们收集并标准化了来自多样化任务的提示,将其用于并非为其设计任务的数据集。随后我们在固定的多项选择数据集上评估这些提示,以定量分析提示的某些属性如何影响性能。我们发现,包含选项以及使用预训练期间未用过的提示可带来显著改进。所有实验与代码见 https://github.com/gabeorlanski/zero-shot-cross-task。

关键词

引用

@article{arxiv.2203.15754,
  title  = {Evaluating Prompts Across Multiple Choice Tasks In a Zero-Shot Setting},
  author = {Gabriel Orlanski},
  journal= {arXiv preprint arXiv:2203.15754},
  year   = {2022}
}

备注

4 pages, 4 figures