中文

Sinhala 文本简化数据集与评估:SiTSE

计算与语言 2024-12-03 v1

摘要

文本简化是已在低资源语言上最小化探索的任务。因此,只有少数人工策划的数据集。在本文中,我们提出了一个针对斯林哈拉语言的人工策划的句子级文本简化数据集。我们的评估数据集包含1000个复杂句子和由三个不同人类注释者生成的3000个简化句子。我们将文本简化任务建模为一个零-shot 和零资源序列到序列(seq-seq)任务,基于 mT5 和 mBART 上的多语言语言模型。我们利用来自相关 seq-seq 任务的辅助数据,并探索使用中间任务迁移学习(ITTL)的可能性。我们的分析显示,ITTL 在文本简化方面优于此前提出的零资源方法。我们的发现也突显了在评估文本简化系统方面的挑战,并支持对测量低资源语言上自动文本简化系统质量的指标进行改进的呼声。我们的代码和数据公开可访问:https://github.com/brainsharks-fyp17/Sinhala-Text-Simplification-Dataset-and-Evaluation

关键词

引用

@article{arxiv.2412.01293,
  title  = {SiTSE: Sinhala Text Simplification Dataset and Evaluation},
  author = {Surangika Ranathunga and Rumesh Sirithunga and Himashi Rathnayake and Lahiru De Silva and Thamindu Aluthwala and Saman Peramuna and Ravi Shekhar},
  journal= {arXiv preprint arXiv:2412.01293},
  year   = {2024}
}