中文

Zemi:从多任务中学习零样本半参数语言模型

计算与语言 2023-05-24 v2

摘要

尽管大语言模型已展现出令人印象深刻的零样本能力,但其巨大的模型规模通常带来高昂成本。近来,半参数语言模型(即通过一个外部检索器来增强较小的语言模型)已展现出有前景的语言建模能力。然而,此类半参数语言模型在下游任务的零样本泛化上是否能与其全参数对应模型竞争性地表现良好,仍不明确。在本工作中,我们提出 Zemi\text{Zemi},一个零样本半参数语言模型。据我们所知,这是首个能在广泛留出的未见任务上展现强大零样本性能的半参数语言模型。我们以一种新的半参数多任务提示训练范式来训练 Zemi\text{Zemi},其相比 T0 所提出的参数化多任务训练有显著改进。具体而言,我们利用来自大规模任务无关无标注语料的检索来增强多任务训练与零样本评估。为融合多个潜在含噪的检索增强,我们进一步提出一个新的 augmentation fusion\text{augmentation fusion}(增强融合)模块,利用感知重采样器(perceiver resampler)与门控交叉注意力(gated cross-attention)。值得注意的是,我们提出的 ZemiLARGE\text{Zemi}_\text{LARGE} 在所有七个评估任务上以 3.9 倍更小的模型规模超越了 T0-3B 达 16%。

关键词

引用

@article{arxiv.2210.00185,
  title  = {Zemi: Learning Zero-Shot Semi-Parametric Language Models from Multiple Tasks},
  author = {Zhenhailong Wang and Xiaoman Pan and Dian Yu and Dong Yu and Jianshu Chen and Heng Ji},
  journal= {arXiv preprint arXiv:2210.00185},
  year   = {2023}
}

备注

Accepted as a conference paper at Findings of ACL 2023