中文

面向西班牙语文本简化的金融教育新数据集

人工智能 2023-12-18 v1

摘要

文本简化在自然语言处理中至关重要,旨在使文本更易于理解,特别是对于特定群体,例如视障西班牙语使用者,这是该领域中代表性不足的语言。在西班牙语中,可用于创建文本简化系统的数据集很少。我们的研究主要目标是开发一个西班牙语金融文本简化数据集。我们使用既定的简化规则创建了一个包含 5,314 个复杂与简化句子对的数据集。我们还比较了我们的数据集与 GPT-3、Tuner 和 MT5 生成的简化结果,以评估使用这些系统进行数据增强的可行性。在本文中,我们展示了我们数据集的特征以及与其他系统比较的发现。该数据集可在 Hugging face 获取,saul1917/FEINA。

关键词

引用

@article{arxiv.2312.09897,
  title  = {A Novel Dataset for Financial Education Text Simplification in Spanish},
  author = {Nelson Perez-Rojas and Saul Calderon-Ramirez and Martin Solis-Salazar and Mario Romero-Sandoval and Monica Arias-Monge and Horacio Saggion},
  journal= {arXiv preprint arXiv:2312.09897},
  year   = {2023}
}