用于零样本泛化的通用判别器
计算与语言
2023-06-07 v2
摘要
生成式建模一直是大规模预训练和零样本泛化的主导方法。在这项工作中,我们挑战这一惯例,表明判别方法在大量 NLP 任务上的表现大幅优于生成方法。在技术上,我们训练单个判别器来预测文本样本是否来自真实数据分布,类似于 GAN。由于许多 NLP 任务可表述为从少数选项中进行选择,我们使用该判别器预测输入与哪个选项的连接具有来自真实数据分布的最高概率。这一简单表述在 T0 基准上实现了最先进的零样本结果,在不同规模上分别比 T0 高出 16.0%、7.8% 和 11.5%。在微调设定下,我们的方法也在广泛的 NLP 任务上实现了新的最先进结果,且仅需先前方法 1/4 的参数。同时,我们的方法需要极少的提示工作,这大幅提高了鲁棒性并对实际应用至关重要。此外,我们还将广义 UD 与生成任务联合训练,其在判别任务上保持优势的同时也能处理生成任务。
引用
@article{arxiv.2211.08099,
title = {A Universal Discriminator for Zero-Shot Generalization},
author = {Haike Xu and Zongyu Lin and Jing Zhou and Yanan Zheng and Zhilin Yang},
journal= {arXiv preprint arXiv:2211.08099},
year = {2023}
}
备注
ACL 2023 main conference (Long paper)