大型语言模型在中文电影剧本续写中的比较研究:基于 GPT-5.2 和 Qwen-Max 的实证分析
计算与语言
2026-01-22 v1
摘要
随着大型语言模型 (LLM) 越来越多地应用于创意写作,其在特定文化叙事任务上的表现值得系统研究。本研究构建了首个包含 53 部经典电影的中文电影剧本续写基准,并设计了比较 GPT-5.2 和 Qwen-Max-Latest 的多维度评估框架。使用“前半部到后半部”续写范式,每部电影 3 个样本,我们获得了 303 个有效样本(GPT-5.2:157 个,98.7% 有效率;Qwen-Max:146 个,91.8% 有效率)。评估集成了 ROUGE-L、结构相似性和 LLM-as-Judge 评分 (DeepSeek-Reasoner)。对 144 个配对样本的统计分析表明:Qwen-Max 的 ROUGE-L 略高(0.2230 对 0.2114,d=-0.43);然而,GPT-5.2 在结构保持(0.93 对 0.75,d=0.46)、整体质量(44.79 对 25.72,d=1.04)和综合得分(0.50 对 0.39,d=0.84)上显著优于 Qwen-Max。整体质量效应量达到大效应水平(d>0.8)。GPT-5.2 在角色一致性、语气风格匹配和格式保持方面表现出色,而 Qwen-Max 在生成稳定性方面存在不足。本研究为中文创意写作中的 LLM 评估提供了可复现的框架。
引用
@article{arxiv.2601.14826,
title = {Comparative Study of Large Language Models on Chinese Film Script Continuation: An Empirical Analysis Based on GPT-5.2 and Qwen-Max},
author = {Yuxuan Cao and Zida Yang and Ye Wang},
journal= {arXiv preprint arXiv:2601.14826},
year = {2026}
}
备注
18 pages, 6 figures, 6 tables, 20 references. First two authors contributed equally. Corresponding author: Ye Wang ([email protected])