中文

跨领域文本创造力评估:数据集与大型语言模型评估器

计算与语言 2026-01-30 v2

摘要

创造力评估仍然是大型语言模型(LLMs)面临的一项具有挑战性的前沿课题。当前的评估严重依赖低效且昂贵的人工判断,阻碍了机器创造力提升方面的进展。尽管存在自动化方法,包括从心理测试到基于启发式或提示的方法,但它们通常缺乏泛化能力或与人类判断的一致性。为了解决这些问题,我们提出了一种新颖的成对比较框架,用于评估文本创造力,该框架利用共享的上下文指令来提高评估的一致性。我们引入了 CreataSet,这是一个包含 10 万以上人类级别和 100 万以上合成创造性指令-响应对的大规模数据集,涵盖多样化的开放领域任务。通过在 CreataSet 上进行训练,我们开发了一个名为 CrEval 的基于 LLM 的评估器。CrEval 在与人类判断的一致性方面表现出优于现有方法的显著优越性。实验结果强调了整合人类和合成数据对于训练高度鲁棒的评估器的不可或缺性,并展示了 CrEval 在提升 LLM 创造力方面的实用价值。

关键词

引用

@article{arxiv.2505.19236,
  title  = {Evaluating Text Creativity across Diverse Domains: A Dataset and Large Language Model Evaluator},
  author = {Qian Cao and Xiting Wang and Yuzhuo Yuan and Yahui Liu and Fang Luo and Ruihua Song},
  journal= {arXiv preprint arXiv:2505.19236},
  year   = {2026}
}

备注

Accepted by ICLR 2026