中文

基于无噪声数据的跨语言数据到文本生成的课程学习

计算与语言 2024-12-19 v1

摘要

课程学习已被用于通过依据特定计划对训练样本进行排序来提高文本生成系统的质量。在数据到文本生成(DTG)的上下文中,先前的研究使用各种难度标准来对单语言DTG的训练样本进行排序。然而,这些标准无法推广到该问题的跨语言版本,也不考虑噪声数据。我们探索了多种可用于改进使用两种课程计划处理噪声数据的跨语言DTG系统性能的准则。通过对排序样本使用对齐得分标准,并采用退火计划训练模型,我们在11种印度语言和英语的2个数据集上,将BLEU分数提高了最高4分,平均提高了5-15%的忠实性和生成覆盖率。我们公开了代码和数据。

关键词

引用

@article{arxiv.2412.13484,
  title  = {Curriculum Learning for Cross-Lingual Data-to-Text Generation With Noisy Data},
  author = {Kancharla Aditya Hari and Manish Gupta and Vasudeva Varma},
  journal= {arXiv preprint arXiv:2412.13484},
  year   = {2024}
}