中文

评估语言模型创意性:代码生成案例研究

计算与语言 2025-02-11 v2

摘要

随着大语言模型(LLM)的广泛应用,如何让这些模型表现出“创造力”成为一个值得关注的问题。从认知科学角度看,创造力至少包含两个关键特征:收敛性思维(为实现给定目标而具有目的性)和发散性思维(适应性地探索新环境或约束条件)\citep{runco2003critical}。本文引入了一个量化LLM创意的框架,该框架包含两个设计要素:(1)我们引入DENIAL PROMPTING(否定提示),通过逐步施加新的约束来推动LLM为给定问题开发更具创造性的解决方案,迫使其采用新策略。(2)我们定义NEOGAUGE(新认知评估)度量标准,用于量化LLM在生成的创造性响应中表现出的收敛性和发散性思维。我们在Codeforces问题上测试了所提出的框架,这些问题既是编码任务的自然数据集,也是人类解决方案的集合。我们对各种专有和开源模型进行NEOGAUGE评估,发现即使是最具创造力的模型GPT-4,也未能展现出类人水平的创造力。我们还实验了一些先进的推理策略(如MCTS、自我纠正等),但未观察到创意性的显著提升。作为 our analysis 的副产品,我们发布了NEOCODER数据集,用于在未来模型上复现我们的实验结果。

关键词

引用

@article{arxiv.2407.09007,
  title  = {Benchmarking Language Model Creativity: A Case Study on Code Generation},
  author = {Yining Lu and Dixuan Wang and Tianjian Li and Dongwei Jiang and Sanjeev Khudanpur and Meng Jiang and Daniel Khashabi},
  journal= {arXiv preprint arXiv:2407.09007},
  year   = {2025}
}