中文

CMDAG:带有标注喻底作为思维链以增强隐喻生成的中文隐喻数据集

计算与语言 2024-02-22 v2 人工智能

摘要

隐喻是人类语言和文学中一种突出的语言手段,因为它增添了色彩、意象和强调,从而增强有效沟通。本文介绍了一个大规模高质量的标注中文隐喻语料库,包含约 2.8 万句源自各种中文文学来源(如诗歌、散文、歌词等)的句子。为了确保标注的准确性和一致性,我们引入了一套全面的指南。这些指南涵盖了隐喻标注的各个方面,包括识别本体、喻体和喻底,以及处理明喻、拟人、并列和夸张的复杂性。打破传统,我们的隐喻生成方法强调喻底及其独特特征,而不是传统的本体和喻体组合。通过将“喻底”作为思维链(Chain of Thoughts, CoT)输入整合,我们能够生成更符合现实直觉的隐喻。我们使用标注语料库测试了 Belle、Baichuan 和 Chinese-alpaca-33B 等生成模型。这些模型能够更频繁地生成由我们数据集中选定样本诱发的创造性且流畅的隐喻句子,展示了我们的语料库对中文隐喻研究的价值。代码可在 https://github.com/JasonShao55/Chinese_Metaphor_Explanation 获取。

关键词

引用

@article{arxiv.2402.13145,
  title  = {CMDAG: A Chinese Metaphor Dataset with Annotated Grounds as CoT for Boosting Metaphor Generation},
  author = {Yujie Shao and Xinrong Yao and Xingwei Qu and Chenghua Lin and Shi Wang and Stephen W. Huang and Ge Zhang and Jie Fu},
  journal= {arXiv preprint arXiv:2402.13145},
  year   = {2024}
}