Gen-Z:基于上下文标签描述的生成式零样本文本分类
计算与语言
2023-11-14 v1
摘要
语言模型(LM)提示——一种解决 NLP 任务的主流范式——已被证明易受误校准及对细微提示变动的脆弱性影响,其原因在于判别式提示方法,即给定输入预测标签。为解决这些问题,我们提出 Gen-Z——一种用于零样本文本分类的生成式提示框架。GEN-Z 是生成式的,因其衡量以自然语言标签描述为前提的 LM 输入文本似然。该框架是多变量的,因为标签描述使我们能够无缝整合关于标签的额外上下文信息以提升任务性能。在多个标准分类基准上,使用六个开源 LM 系列,我们展示了通过对评估集数据源进行简单上下文化处理的零样本分类,始终优于零样本与少样本基线,同时提升了对提示变动的鲁棒性。此外,我们的方法能够通过将作者、主题或读者信息纳入标签描述,以零样本方式实现分类个性化。
引用
@article{arxiv.2311.07115,
title = {Gen-Z: Generative Zero-Shot Text Classification with Contextualized Label Descriptions},
author = {Sachin Kumar and Chan Young Park and Yulia Tsvetkov},
journal= {arXiv preprint arXiv:2311.07115},
year = {2023}
}