中文

CERD:面向散文修辞理解与生成的综合中文修辞数据集

计算与语言 2024-10-01 v1

摘要

现有修辞理解与生成数据集或语料库主要聚焦于单一粗粒度或细粒度类别,忽视了不同修辞手法之间常见的相互关联,因而将其视为独立子任务。本文提出了中文散文修辞数据集(CERD),包含 4 种常用粗粒度类别(隐喻、拟人、夸张、对仗)以及 23 种细粒度类别,涵盖形式层面与内容层面。CERD 是一个手动标注的、全面的中文修辞数据集,包含五个相互关联的子任务。与前期工作不同,CERD 有助于理解各种修辞手法、识别相应的修辞成分,以及在给定条件下生成修辞句子,从而提升作者的写作水平和语言运用能力。开展大量实验以展示 CERD 中多个任务之间的相互关系,并为后续研究建立基准。实验结果表明,大型语言模型在大多数任务上取得最佳性能,联合微调多个任务进一步提升性能。

关键词

引用

@article{arxiv.2409.19691,
  title  = {CERD: A Comprehensive Chinese Rhetoric Dataset for Rhetorical Understanding and Generation in Essays},
  author = {Nuowei Liu and Xinhao Chen and Hongyi Wu and Changzhi Sun and Man Lan and Yuanbin Wu and Xiaopeng Bai and Shaoguang Mao and Yan Xia},
  journal= {arXiv preprint arXiv:2409.19691},
  year   = {2024}
}