基于 LED 驱动的 ARMAN 模型用于波斯语长文档抽象摘要
计算与语言
2025-03-14 v1
摘要
文本数据的日益增长给阅读和理解大型文档带来了挑战,尤其是对于需要从研究文章中提取有用信息的学者而言。自动文本摘要已成为将冗长文档浓缩为简洁且有信息量摘要的强大工具。根据所采用的方法,文本摘要可分为抽取式或抽象式。虽然抽取式方法因其简单性而常被使用,但常常遗漏重要信息。相比之下,抽象式摘要能够通过理解文本 underlying 意义来生成更连贯且有信息量的摘要。抽象式技术在 various 语言中已受到关注,近期通过基于 BERT、BART 和 T5 等预训练模型取得了突破。然而,长文档摘要的挑战仍然存在,Longformer 等替代模型被引入以解决这一限制。在此背景下,本文聚焦于波斯语的抽象式摘要。作者引入了来自 Ensani 网站获取的 30 万篇完整波斯语论文的数据集,并应用基于 Longformer 架构的 ARMAN 模型生成摘要。实验结果表明,波斯语文本摘要表现前景广阔。该论文提供了相关工作的综述,讨论了方法,呈现了实验结果,并指出了未来研究方向。
引用
@article{arxiv.2503.10233,
title = {ARLED: Leveraging LED-based ARMAN Model for Abstractive Summarization of Persian Long Documents},
author = {Samira Zangooei and Amirhossein Darmani and Hossein Farahmand Nezhad and Laya Mahmoudi},
journal= {arXiv preprint arXiv:2503.10233},
year = {2025}
}
备注
11 pages, 3 tables