中文

数据到文本自然语言生成系统综述

计算与语言 2024-02-28 v3 人工智能 机器学习

摘要

本系统综述对当前数据到文本生成研究进行全面分析,识别了该领域中的空白、挑战与未来方向。综述了关于数据集、评估指标、应用领域、多语言性、语言模型以及幻觉缓解方法的相关文献。探讨了 various methods for producing high-quality text, 包括重新排序、传统和神经管道架构、规划架构、数据清洗、受控生成以及模型和训练技术的修改。评估了这些方法的有效性与局限性,突出了需要通用策略以缓解幻觉的重要性。综述还考察了数据集的使用、流行度与影响,以及评估指标,强调了自动与人类评估。此外,讨论了数据到文本模型的演变,尤其是 transformer 模型的广泛采用。尽管文本质量取得了进步,综述强调了在低资源语言中的研究的重要性,以及这些语言数据集的工程化,以促进包容性。最后,概述了数据到文本的多个应用领域,强调其在这些领域中的相关性。总体而言,本综述为推动数据到文本生成的创新与发展提供了指导框架。

关键词

引用

@article{arxiv.2402.08496,
  title  = {A Systematic Review of Data-to-Text NLG},
  author = {Chinonso Cynthia Osuji and Thiago Castro Ferreira and Brian Davis},
  journal= {arXiv preprint arXiv:2402.08496},
  year   = {2024}
}