低资源设置下超长文档抽象式摘要的先分割后合并方法
计算与语言
2025-05-13 v1 信息检索
摘要
BIGBIRD-PEGASUS模型在长文档抽象式文本摘要任务上取得了state-of-the-art性能。然而其容量仍限于最多4,096个token,因此在超长文档摘要任务上出现了性能退化。处理该问题的常用方法是截断文档。在本研究中,我们采用不同的方法。我们使用预训练的BIGBIRD-PEGASUS模型,通过在其他领域数据集上进行微调来训练模型。首先,我们筛选出所有长度小于20,000个token的文档,以聚焦于超长文档。为防止迁移学习中的领域偏移问题和小数据集上的过拟合,我们通过将文档-摘要训练对拆分为多个部分来增强数据集,使文档适配于4,096个token。源代码可在https://github.com/lhfazry/SPIN-summ获取。
引用
@article{arxiv.2505.06862,
title = {A Split-then-Join Approach to Abstractive Summarization for Very Long Documents in a Low Resource Setting},
author = {Lhuqita Fazry},
journal= {arXiv preprint arXiv:2505.06862},
year = {2025}
}