中文

面向大型语言模型的自动创意性评估:基于参考的方法

计算与语言 2025-04-23 v1 人工智能

摘要

创意写作是大型语言模型(LLMs)的关键能力,具有文学、叙事及各类创意领域的潜在应用。然而,评估机器生成文本的创意性仍是一个重大挑战,因为现有方法要么依赖高成本的手动标注,要么未与人类评估紧密对齐。本文提出一种基于《创意写作测试》(TTCW)的有效自动评估方法,将创意性评估为产品。该方法采用参考基准的Likert式方法,对在各种测试中相对于高质量参考文本对生成的创意文本进行评分。实验结果表明,我们的方法显著提高了LLM评估与人类评估之间的对齐程度,使两两准确率达到0.75(提升15%)。

关键词

引用

@article{arxiv.2504.15784,
  title  = {Automated Creativity Evaluation for Large Language Models: A Reference-Based Approach},
  author = {Ruizhe Li and Chiwei Zhu and Benfeng Xu and Xiaorui Wang and Zhendong Mao},
  journal= {arXiv preprint arXiv:2504.15784},
  year   = {2025}
}