中文

DORE:用于葡萄牙语定义生成的数据集

计算与语言 2024-03-29 v2 机器学习

摘要

定义建模(DM)是自动为特定单词生成字典定义的任务。能够进行DM的计算系统具有诸多应用,能惠及广泛的受众群体。由于DM被视为监督式自然语言生成问题,这些系统需要大量标注数据集来训练机器学习(ML)模型。虽然葡萄牙语在大多数自然语言处理任务中被视为中/高资源语言,并且拥有超过2000万母语者,但目前尚无可供DM使用的葡萄牙语数据集。本研究通过引入DORE来填补这一空白;该数据集包含超过10万个定义,是首个用于葡萄牙语定义建模的数据集。我们还在DORE上评估了Several深度学习基于DM模型并报告了结果。该数据集和本文的研究结果将促进葡萄牙语在更广泛语境下的研究与学习。

关键词

引用

@article{arxiv.2403.18018,
  title  = {DORE: A Dataset For Portuguese Definition Generation},
  author = {Anna Beatriz Dimas Furtado and Tharindu Ranasinghe and Frédéric Blain and Ruslan Mitkov},
  journal= {arXiv preprint arXiv:2403.18018},
  year   = {2024}
}

备注

Accepted to LREC-COLING 2024 (The 2024 Joint International Conference on Computational Linguistics, Language Resources and Evaluation)