中文

ByGPT5:基于无词元语言模型的端到端风格条件诗歌生成

计算与语言 2024-03-05 v2

摘要

当前最先进的诗歌生成系统通常较为复杂。它们要么由特定任务的模型流水线组成,要么以人工创建约束的形式融入先验知识,或两者兼有。相比之下,端到端模型不会受限于必须对先验知识进行建模的开销,且能够仅从数据中学习诗歌的细微特征,从而降低所需的人工监督程度。在本工作中,我们研究了以押韵、格律和头韵等风格为条件的端到端诗歌生成。我们识别并解决了训练数据缺乏以及分词算法不匹配作为过往尝试潜在局限性的问题。具体而言,我们成功预训练了 ByGPT5——一种新的无词元(token-free)仅解码器语言模型,并在一个包含带有我们风格标注的英文和德文四行诗的大型自定义语料库上对其进行了微调。我们表明,ByGPT5 优于 mT5、ByT5、GPT-2 和 ChatGPT 等其他模型,同时具有更高的参数效率,且与人类相比表现良好。此外,我们分析了其运行时性能,并证明它不易产生记忆现象。我们公开了我们的代码、模型和数据集。

关键词

引用

@article{arxiv.2212.10474,
  title  = {ByGPT5: End-to-End Style-conditioned Poetry Generation with Token-free Language Models},
  author = {Jonas Belouadi and Steffen Eger},
  journal= {arXiv preprint arXiv:2212.10474},
  year   = {2024}
}

备注

Accepted at ACL 2023 (main track)