基于提示的伪标注策略用于样本高效的半监督抽取式摘要
计算与语言
2024-07-03 v3 人工智能
摘要
半监督学习(SSL)是一种在标注数据稀缺、未标注数据丰富的场景中广泛使用的技术。虽然 SSL 在图像和文本分类中很流行,但在抽取式文本摘要任务上的探索相对较少。标准 SSL 方法遵循教师-学生范式,先训练一个分类模型,然后利用分类器的置信度值来为后续训练周期选择伪标签;然而,此类分类器由于缺乏针对评估的特定调优,不适合衡量伪标签的准确性,导致置信度值无法捕捉生成摘要的语义与正确性。为解决该问题,我们提出了一种基于 LLM 的提示式伪标注策略,其挑选的未标注样本所带伪标签比仅使用分类器概率输出更准确。我们的方法还包含一种重标注机制,可提升伪标签质量。我们在三个文本摘要数据集上评估了该方法:TweetSumm、WikiHow 和 ArXiv/PubMed。我们通过实验表明,基于提示的 LLM 对伪标签进行打分与生成,在全部数据集上的 ROUGE-1、ROUGE-2 和 ROUGE-L 分数均优于现有 SSL 方法。此外,在数据稀缺设定下,我们的方法取得了与全监督方法相竞争的 L-Eval 分数(使用 LLaMa-3 评估);而在数据丰富设定下则优于全监督方法。
引用
@article{arxiv.2311.09559,
title = {Prompt-based Pseudo-labeling Strategy for Sample-Efficient Semi-Supervised Extractive Summarization},
author = {Gaurav Sahu and Olga Vechtomova and Issam H. Laradji},
journal= {arXiv preprint arXiv:2311.09559},
year = {2024}
}
备注
8 pages, 6 figures, 3 tables