有效利用 LLM 进行低资源文本摘要的指南:数据增强与半监督方法
计算与语言
2025-01-27 v2 人工智能
摘要
现有的低资源文本摘要方法主要在推理时使用 GPT-3 或 GPT-4 等大语言模型(LLM)直接生成摘要;然而,此类方法经常受到 LLM 输出不一致的困扰,且难以适应低资源场景中的特定领域数据。在这项工作中,我们提出了两种有效利用 LLM 进行低资源文本摘要的新方法:1)MixSumm,一种基于 LLM 的数据增强方案,用于为少样本文本摘要合成高质量文档(短篇和长篇);2)PPSL,一种基于提示的伪标签策略,用于样本高效的半监督文本摘要。具体而言,MixSumm 利用开源的 LLaMA-3-70b-Instruct 模型,通过混合从少量种子集中提取的主题信息来生成新文档,而 PPSL 利用 LLaMA-3-70b-Instruct 模型在半监督学习设置中生成高质量的伪标签。我们在 TweetSumm、WikiHow 和 ArXiv/PubMed 数据集上评估了我们的方法,并使用 L-Eval(一种基于 LLaMA-3 的评估指标)和 ROUGE 分数来衡量生成摘要的质量。我们在抽取式和生成式摘要上的实验表明,MixSumm 和 PPSL 在仅使用 5% 标记数据的情况下,取得了与完全监督方法相当的 ROUGE 分数。
引用
@article{arxiv.2407.07341,
title = {A Guide To Effectively Leveraging LLMs for Low-Resource Text Summarization: Data Augmentation and Semi-supervised Approaches},
author = {Gaurav Sahu and Olga Vechtomova and Issam H. Laradji},
journal= {arXiv preprint arXiv:2407.07341},
year = {2025}
}
备注
Accepted to NAACL 2025 (Findings)