通过高效的情境学习和高效的微调提升新闻摘要
计算与语言
2024-05-07 v1
摘要
随着每日新闻周期提供信息的海量增长,有效且高效地为快速消费准备新闻摘要的需求日益增长。我们利用大型语言模型(LLM),其在学习和生成能力上优于传统语言模型,用于生成来自 XSum 数据集的新闻文章的简洁且连贯的摘要。我们的论文聚焦于 LLM 的两个关键方面:高效情境学习(ELearn)和参数高效微调(EFit)。在 ELearn 方面,我们发现增加提示中的 shot 数量并利用简单模板通常会提高摘要质量。我们也发现,利用 few-shot 学习中相关示例并不会提高模型性能。在此基础上,我们研究了 EFit,使用不同方法并证明对 LLM 的第一层进行微调的效果优于对其他层进行微调或利用 LoRA。我们也发现,利用更相关的训练样本通过选择性层数并不会导致更好的性能。通过组合 ELearn 和 EFit,我们创建了一个新模型(ELearnFit),该模型综合了 few-shot 学习和微调的优势,产生的性能优于单独使用的任何模型。我们还使用 ELearnFit 来突出显示在仅有限数量的标注样本可用时,提示和微调之间的权衡。最终,我们的研究提供了在提示和微调阶段优化新闻摘要的实用技术,增强了新闻文章的综合。
引用
@article{arxiv.2405.02710,
title = {Enhancing News Summarization with ELearnFit through Efficient In-Context Learning and Efficient Fine-Tuning},
author = {Che Guan and Andrew Chin and Puya Vahabi},
journal= {arXiv preprint arXiv:2405.02710},
year = {2024}
}
备注
9 Pages