利用银标准数据进行信息抽取中的零样本分类任务
计算与语言
2024-03-07 v2 人工智能
摘要
信息抽取(IE)领域监督分类方法的卓越性能高度依赖于大量金标准数据。近期的零样本分类方法将该任务转化为其他自然语言处理(NLP)任务(例如文本蕴含),并利用这些 NLP 任务的现成模型直接在测试数据上进行推理,而无需使用大量 IE 标注数据。这些方法的一个潜在有价值的副产品是大规模银标准数据,即由其他 NLP 任务的现成模型生成的伪标注数据。然而,目前尚无针对这些数据使用的进一步研究。在本文中,我们提出了一种新框架 Clean-LaVe,旨在利用银标准数据提升零样本性能。Clean-LaVe 包含四个阶段:(1) 获取银标准数据;(2) 从银标准数据中识别相对干净的数据;(3) 使用干净数据微调现成模型;(4) 对测试数据进行推理。实验结果表明,在零样本关系分类任务中,Clean-LaVe 在 TACRED 和 Wiki80 数据集上的表现分别优于基线 5% 和 6%;在零样本跨语言关系分类任务中,在 Smile(韩语和波兰语)数据集上优于基线 3%-7%;在零样本事件论元分类任务中,在 ACE05-E+ 数据集上优于基线 8%。代码已开源:https://github.com/wjw136/Clean_LaVe.git。
引用
@article{arxiv.2402.18061,
title = {On the use of Silver Standard Data for Zero-shot Classification Tasks in Information Extraction},
author = {Jianwei Wang and Tianyin Wang and Ziqian Zeng},
journal= {arXiv preprint arXiv:2402.18061},
year = {2024}
}
备注
accepted by coling2024. arXiv:2211.13883 is our first edition