中文

儿童故事的自动生成与简化

计算与语言 2023-10-31 v1

摘要

随着大语言模型(LLMs)的近期进展,自动生成儿童教育材料的概念已变得日益现实。为实现生成教育文本中适合年龄的简洁性这一目标,我们首先考察了若干流行 LLM 生成具有恰当调整的词汇与可读性水平故事的能力。我们发现,尽管 LLM 能力不断增强,它们尚不具备将词汇限制在适合低龄群体水平的能力。作为第二项实验,我们探索了最先进的词汇简化模型泛化到儿童故事领域的能力,从而为其自动生成构建高效流水线。为测试这些模型,我们开发了一个面向儿童的词汇简化实例数据集,其示例取自第一项实验中 LLM 生成的故事。我们发现,尽管当前性能最强的词汇简化模型因幕后依赖大语言模型而在专为儿童设计的材料上表现不佳,但一些在通用数据上仍取得相当强结果的模型,通过我们使用新创建的面向儿童的简化数据集进行的恰当微调,能够模仿甚至提升其在儿童导向数据上的表现。

关键词

引用

@article{arxiv.2310.18502,
  title  = {On the Automatic Generation and Simplification of Children's Stories},
  author = {Maria Valentini and Jennifer Weber and Jesus Salcido and Téa Wright and Eliana Colunga and Katharina Kann},
  journal= {arXiv preprint arXiv:2310.18502},
  year   = {2023}
}

备注

Accepted to EMNLP 2023 (main conference)