中文

CML-Bench:评估与增强 LLM 生成电影剧本的框架

计算机视觉与模式识别 2025-10-09 v1 计算与语言

摘要

大型语言模型 (LLM) 在生成高度结构化文本方面已显示出惊人的能力。然而,尽管具有高度的结构组织,电影剧本还要求额外的细腻叙事和情感深度——即引人入胜的电影的“灵魂”——而 LLM 往往难以捕捉这一点。为调查这一不足,我们首先策划了 CML-Dataset,包含 (摘要、内容) 对的数据集,用于电影标记语言 (CML),其中“内容”由来自优秀高质量电影剧本的片段组成,而“摘要”是内容的简洁描述。通过对这些真实剧本中内在的多shot 连续性和叙事结构进行深入分析,我们识别出三个关键评估维度:对话连贯性 (DC)、角色一致性 (CC) 和情节合理性 (PR)。基于这些发现,我们提出了 CML-Bench,配备这些维度上的量化指标。CML-Bench 能够为精心编写的、人类编写的剧本赋予高分,同时同时指出由 LLM 生成的剧本的弱点。为进一步验证我们的基准,我们引入了 CML-Instruction,即一种引导 LLM 生成更结构化、电影化的剧本的提示策略,详细说明角色对话和事件逻辑。广泛的实验验证了我们的基准的有效性,并表明受 CML-Instruction 指导的 LLM 生成的剧本质量更高,结果与人类偏好相吻合。

关键词

引用

@article{arxiv.2510.06231,
  title  = {CML-Bench: A Framework for Evaluating and Enhancing LLM-Powered Movie Scripts Generation},
  author = {Mingzhe Zheng and Dingjie Song and Guanyu Zhou and Jun You and Jiahao Zhan and Xuran Ma and Xinyuan Song and Ser-Nam Lim and Qifeng Chen and Harry Yang},
  journal= {arXiv preprint arXiv:2510.06231},
  year   = {2025}
}

备注

24 pages, 9 figures