中文

QUIET:一个多空位级联故事填空基准,用于 LLM 创意生成能力评估

计算与语言 2026-05-26 v1 人工智能 机器学习

摘要

大型语言模型( LLM)在创意能力评估方面面临双重挑战:现有基准(如故事填空测试、HellaSwag)测量模型在叙事延续上的判别能力,使用多选识别范式,而非直接测量创意生成能力;基于评估标准的评分和 LLM 作为评判的方法依赖主观维度评估或自然语言模型输出,无法提供客观、自动化的评分机制。本文提出 QUIET(通过内置评估测试质量理解),这是一种基于多空位级联故事填空的 LLM 创意能力诊断基准。QUIET 在具有完整结构的故事中设置 N 个空位(10-20),每个空位都伴随明确的内容约束,空位之间存在级联依赖关系——早期空位的内容限制了后续空位的可行解空间。在开放式生成模式下,对所评估模型(或人类参与者)进行全部空位的填充;结果通过信息论自动评分协议进行评分,而无需人工评分。该评分协议直接操作化了“校准惊讶”理论框架(Zou & Xu, 2026a)。对于每个空位 k,计算一个复合得分:score = satisfy * (1 + lambda * surprise),其中 lambda=1.0。其中,"satisfy"衡量空位填充是否满足内容约束(客观逻辑推理判断,非主观审美评分),"surprise"衡量在满足约束的前提下,其惊讶程度。不满足约束的创意答案得分为零;满足约束但平庸的答案得分较低;满足约束且令人惊讶的答案得分较高。

关键词

引用

@article{arxiv.2605.25955,
  title  = {QUIET: A Multi-Blank Cascaded Story Cloze Benchmark for LLM Creative Generation Capability},
  author = {Bo Zou and Chao Xu},
  journal= {arXiv preprint arXiv:2605.25955},
  year   = {2026}
}