CCiV:评估 LLM 生成中文 \textit{Ci} 诗的结构、韵律与质量基准
计算与语言
2026-02-17 v1
摘要
生成古典中文 \textit{Ci} 诗——一种需要结构刚性、韵律和谐与艺术质量的复杂技能——是大语言模型(LLM)面临的重大挑战。为系统评估和推进这一能力,我们引入 \textbf{C}hinese \textbf{Ci}pai \textbf{V}ariants (\textbf{CCiV}),一个旨在衡量 LLM 生成的 \textit{Ci} 诗在三个维度上:结构、韵律与质量的基准。我们对 17 个 LLM 在 30 个 \textit{Cipai} 上的评估揭示了两个关键现象:模型经常生成有效但意外的历史变体诗形式,以及对押韵模式的遵循远比结构规则更困难。我们进一步表明,形式感知提示可以改善结构和押韵控制,尤其对强模型有效,但可能损害弱模型。最后,我们观察到形式正确性与文学质量之间存在弱且不一致的对齐。CCiV 凸显了变体感知评估和更整体受限创造生成方法的必要性。
引用
@article{arxiv.2602.14081,
title = {CCiV: A Benchmark for Structure, Rhythm and Quality in LLM-Generated Chinese \textit{Ci} Poetry},
author = {Shangqing Zhao and Yupei Ren and Yuhao Zhou and Xiaopeng Bai and Man Lan},
journal= {arXiv preprint arXiv:2602.14081},
year = {2026}
}
备注
ARR 2025 May and Icassp 2026 submission. Working in progress