中文

基于马尔可夫链的长文档摘要聚类:解决大语言模型“失于中段”挑战

计算与语言 2025-06-24 v1

摘要

信息来自多样化来源的快速扩张加剧了有效自动文本摘要的需求,这需要将文档浓缩为更简洁且连贯的文本。摘要方法大致可分为两类:抽取式,从原文中选择关键段落;抽象式通过重新表述内容生成连贯的摘要。大型语言模型已推动抽象式摘要领域的发展,但其资源消耗大且在处理长文档时面临显著挑战,即“失于中段”。为解决此问题,本文提出一种混合摘要方法,结合抽取与抽象技术。该方法将文档划分为更小的文本块,对其向量嵌入进行聚类,对每个簇生成代表文档关键思想的摘要,并通过马尔可夫链图在选择思想的语义顺序时构建最终摘要。

关键词

引用

@article{arxiv.2506.18036,
  title  = {Markov-Enhanced Clustering for Long Document Summarization: Tackling the 'Lost in the Middle' Challenge with Large Language Models},
  author = {Aziz Amari and Mohamed Achref Ben Ammar},
  journal= {arXiv preprint arXiv:2506.18036},
  year   = {2025}
}