CRMSP:一种用于关键信息提取的半监督方法,结合类别再平衡与合并语义伪标签
机器学习
2024-07-24 v1 人工智能
摘要
在关键信息提取(KIE)领域,随着对采用半监督学习节省人力和成本的需求增长,因为完全监督的方法需要耗费大量人工标注。KIE 应用半监督学习的主要挑战是(1)在长尾分布下低估尾部类别的置信度,以及(2)难以实现尾部特征的类内紧凑性和类间可分性。为此,我们提出了一种具有类别再平衡和合并语义伪标签(CRMSP)的新型半监督 KIE 方法。首先,类别再平衡伪标签(CRP)模块引入再权重因子,以重新平衡伪标签,增加对尾部类别的关注。其次,我们提出了合并语义伪标签(MSP)模块,通过将样本分配到合并原型(MP)中来聚类未标记数据的尾部特征。此外,我们设计了一个专为 MSP 量身定制的对比损失。大量实验结果表明,CRMSP 在三个著名基准数据集上实现了状态-of-the-art 性能。值得注意的是,CRMSP 在 CORD 数据集上相比最先进的方法提高了 3.24% 的 F1 分数。
引用
@article{arxiv.2407.15873,
title = {CRMSP: A Semi-supervised Approach for Key Information Extraction with Class-Rebalancing and Merged Semantic Pseudo-Labeling},
author = {Qi Zhang and Yonghong Song and Pengcheng Guo and Yangyang Hui},
journal= {arXiv preprint arXiv:2407.15873},
year = {2024}
}