标题引导的泰语新闻文章抽取式摘要
计算与语言
2025-02-11 v2
摘要
文本摘要是压缩长文本同时保留其关键信息的过程。以往的研究主要集中在高资源语言上,而像泰语这样的低资源语言受到的关注较少。此外,早期的泰语文本抽取式摘要模型主要依赖于文章正文,而没有考虑标题。这种遗漏可能导致摘要中遗漏关键句子。为了解决这些局限性,我们提出了 CHIMA,一个将标题上下文信息融入泰语新闻文章的抽取式摘要模型。我们的模型利用预训练语言模型来捕获复杂的语言语义,并为每个句子分配一个被纳入摘要的概率。通过利用标题来指导句子选择,CHIMA 增强了模型恢复重要句子和忽略不相关句子的能力。此外,我们引入了两种聚合标题-正文相似度的策略:简单平均和调和平均,为适应不同的写作风格提供了句子选择的灵活性。在公开可用的泰语新闻数据集上的实验表明,CHIMA 在 ROUGE、BLEU 和 F1 分数上均优于基线模型。这些结果凸显了将标题-正文相似度作为模型指导的有效性。结果还表明,模型回忆关键句子的能力得到了增强,即使是那些分散在文章中间或末尾的句子。凭借这一潜力,标题引导的抽取式摘要为提高泰语新闻文章摘要的质量和相关性提供了一种有前景的方法。
引用
@article{arxiv.2412.01624,
title = {Headline-Guided Extractive Summarization for Thai News Articles},
author = {Pimpitchaya Kositcharoensuk and Nakarin Sritrakool and Ploy N. Pratanwanich},
journal= {arXiv preprint arXiv:2412.01624},
year = {2025}
}
备注
Accepted for publication in IEEE Access