面向印度语言的基于深度学习的文章摘要方法实现
计算与语言
2022-12-13 v1 机器学习
摘要
由于相关数据集的可得性有限,针对低资源印度语言的文本摘要研究一直较少。本文总结了用于 ILSUM 2022 印度语言摘要数据集的多种深度学习方案。ISUM 2022 数据集分别包含以印度英语、印地语和古吉拉特语撰写的新闻文章及其参考摘要。在我们的工作中,我们探索不同的预训练 seq2seq 模型,并用 ILSUM 2022 数据集对其进行微调。在我们的实验中,微调后的 SoTA PEGASUS 模型在英语上表现最佳,带增广数据的微调 IndicBART 模型在印地语上表现最佳,而再次微调的 PEGASUS 模型结合基于翻译映射的方法在古吉拉特语上表现最佳。我们使用 ROUGE-1、ROUGE-2 和 ROUGE-4 作为评估指标对所得推断结果进行评分。
引用
@article{arxiv.2212.05702,
title = {Implementing Deep Learning-Based Approaches for Article Summarization in Indian Languages},
author = {Rahul Tangsali and Aabha Pingle and Aditya Vyawahare and Isha Joshi and Raviraj Joshi},
journal= {arXiv preprint arXiv:2212.05702},
year = {2022}
}
备注
Accepted at ILSUM at FIRE 2022