中文

COIG-Writer:一个包含思维过程的高质量中文创意写作数据集

计算与语言 2025-10-17 v1 人工智能

摘要

大型语言模型在创意写作方面表现出系统性缺陷,尤其是在非英语语境中,训练数据稀缺且缺乏过程级监督。我们提出了COIG-Writer,一个新颖的中文创意写作数据集,通过对高质量文本进行系统性逆向工程,同时捕获多样化的输出及其背后的思维过程。与仅提供输入-输出对的现有数据集不同,COIG-Writer包含1,665个精心整理的三元组,涵盖51种体裁,每个三元组包含:(1) 逆向工程得到的提示词,(2) 记录决策过程的详细创意推理,以及(3) 最终文本。通过全面的实验,我们识别出创意写作的双组分模型:叙事逻辑(由过程监督提供)和语言表达(由通用数据维持)。我们的发现揭示了三个关键见解:(1) 过程监督非常有效,但需要与通用数据结合以保持稳定。需要至少一个创意样本与十二个通用样本的比例才能达到最优性能;低于此阈值,胜率会逐渐下降(从62.75%降至35.78%)。(2) 创意能力具有文化依赖性,不存在跨语言迁移(中文和英文性能差距为89.26个百分点)。(3) 词汇多样性与创意质量呈负相关(TTR悖论),表明高多样性是逻辑缺陷的补偿行为。这些发现表明,卓越的创意产生于逻辑框架与语言基础之间的相互作用,类似于数学推理可以增强但无法取代基础模型中的语言能力。

关键词

引用

@article{arxiv.2510.14763,
  title  = {COIG-Writer: A High-Quality Dataset for Chinese Creative Writing with Thought Processes},
  author = {Yunwen Li and Shuangshuang Ying and Xingwei Qu and Xin Li and Sheng Jin and Minghao Liu and Zhoufutu Wen and Tianyu Zheng and Xeron Du and Qiguang Chen and Jiajun Shi and Wangchunshu Zhou and Jiazhan Feng and Wanjun Zhong and Libo Qin and Stephen Huang and Wanxiang Che and Chenghua Lin and Eli Zhang},
  journal= {arXiv preprint arXiv:2510.14763},
  year   = {2025}
}