中文

CCPM:一个中国古典诗歌匹配数据集

计算与语言 2021-06-04 v1

摘要

诗歌是人类语言最重要的艺术形式之一。近来许多研究聚焦于将诗歌的某些语言学特征(如风格与情感)融入其理解或生成系统。然而,尚无研究关注诗歌语义的理解或评估。因此,我们提出一项新任务,通过诗歌匹配来评估模型对诗歌语义的理解。具体而言,该任务要求模型依据一行诗歌的现代汉语译文,从四个候选中选出一行中国古典诗歌。为构建该数据集,我们首先获取一组中国古典诗歌与现代汉语译文的平行数据,随后在诗歌语料中检索与各行相似的诗歌作为负选项。我们将该数据集命名为中国古典诗歌匹配数据集(CCPM),并于https://github.com/THUNLP-AIPoet/CCPM发布。我们希望该数据集能进一步促进将深层语义融入中国古典诗歌理解与生成系统的研究。我们亦在该数据集上初步运行了BERT的两个变体作为基线。

关键词

引用

@article{arxiv.2106.01979,
  title  = {CCPM: A Chinese Classical Poetry Matching Dataset},
  author = {Wenhao Li and Fanchao Qi and Maosong Sun and Xiaoyuan Yi and Jiarui Zhang},
  journal= {arXiv preprint arXiv:2106.01979},
  year   = {2021}
}