中文

SP-GPT2:越南语诗歌生成中的语义改进

计算与语言 2021-11-01 v1 人工智能 机器学习

摘要

自动文本生成作为计算机创造力的重要一步,近年来受到越来越多的关注。生成式预训练 Transformer 2(GPT2)是取得优异成绩的最先进方法之一。在本文中,我们首次探索 GPT2 在传统越南语诗歌生成中的能力。早前,我们使用基础 GPT2 的实验在生成符合规范模板的诗歌方面表现相当不错。尽管它能从训练数据中学习包括押韵与声调规则在内的模式,但像几乎所有其他文本生成方法一样,生成的诗歌仍存在主题漂移与语义不一致问题。为改善诗歌内部的连贯性,我们提出新模型 SP-GPT2(语义诗歌 GPT2),其构建于 GPT2 模型之上,并增加了一个约束整首诗上下文的额外损失。为更好评估,我们通过自动定量评估与人工评估检验了这些方法。自动与人工评估均表明,我们的方法能生成具有更好连贯性的诗歌,且未因额外损失而损失质量。同时,我们是该主题的先驱。我们发布了首个针对模板生成诗歌、含风格规则词典的计算评分模块。此外,我们首次发布了一个六八体(Luc-Bat)数据集,包含 87609 首六八体诗,约相当于 260 万句,并结合约 83579 首其他风格诗歌一并发布以供进一步探索。代码见 https://github.com/fsoft-ailab/Poem-Generator。

关键词

引用

@article{arxiv.2110.15723,
  title  = {SP-GPT2: Semantics Improvement in Vietnamese Poetry Generation},
  author = {Tuan Nguyen and Hanh Pham and Truong Bui and Tan Nguyen and Duc Luong and Phong Nguyen},
  journal= {arXiv preprint arXiv:2110.15723},
  year   = {2021}
}