中文

面向印度语言的基于深度学习的文章摘要方法实现

计算与语言 2022-12-13 v1 机器学习

摘要

由于相关数据集的可得性有限,针对低资源印度语言的文本摘要研究一直较少。本文总结了用于 ILSUM 2022 印度语言摘要数据集的多种深度学习方案。ISUM 2022 数据集分别包含以印度英语、印地语和古吉拉特语撰写的新闻文章及其参考摘要。在我们的工作中,我们探索不同的预训练 seq2seq 模型,并用 ILSUM 2022 数据集对其进行微调。在我们的实验中,微调后的 SoTA PEGASUS 模型在英语上表现最佳,带增广数据的微调 IndicBART 模型在印地语上表现最佳,而再次微调的 PEGASUS 模型结合基于翻译映射的方法在古吉拉特语上表现最佳。我们使用 ROUGE-1、ROUGE-2 和 ROUGE-4 作为评估指标对所得推断结果进行评分。

关键词

引用

@article{arxiv.2212.05702,
  title  = {Implementing Deep Learning-Based Approaches for Article Summarization in Indian Languages},
  author = {Rahul Tangsali and Aabha Pingle and Aditya Vyawahare and Isha Joshi and Raviraj Joshi},
  journal= {arXiv preprint arXiv:2212.05702},
  year   = {2022}
}

备注

Accepted at ILSUM at FIRE 2022