Active PETs:面向少样本声明验证的模式利用训练主动数据标注优先级方法
计算与语言
2022-10-12 v2 人工智能
摘要
为缓解标注数据稀缺对事实核查系统的影响,我们聚焦于少样本声明验证。尽管近期工作通过提出先进语言模型进行了少样本分类,但关于数据标注优先级的研究仍匮乏,该类研究旨在改进少量标注样本的选择以实现最优模型性能。我们提出Active PETs,一种新颖的加权方法,利用基于多种语言模型的模式利用训练(PET)模型集成,主动选择未标注数据作为标注候选。在两个技术事实核查数据集上并使用六种不同预训练语言模型,将Active PETs用于少样本数据选择相较基线方法展现出一致提升。我们通过进一步集成过采样策略的Active PETs-o取得了进一步改进。我们的方法能够在未标注数据丰富但标注资源有限的条件下有效选择待标注实例,从而持续提升少样本声明验证性能。我们的代码已公开。
引用
@article{arxiv.2208.08749,
title = {Active PETs: Active Data Annotation Prioritisation for Few-Shot Claim Verification with Pattern Exploiting Training},
author = {Xia Zeng and Arkaitz Zubiaga},
journal= {arXiv preprint arXiv:2208.08749},
year = {2022}
}