艺术还是伪作?大型语言模型与创造力的虚假承诺
计算与语言
2024-03-11 v3 人工智能
人机交互
摘要
研究者认为大型语言模型(LLMs)从博客到故事都展现出高质量的写作能力。然而,客观评估一篇写作的创造性是具有挑战性的。受将创造力作为过程来测量的托兰斯创造性思维测验(TTCT)启发,我们利用共识评估技术[3]并提出托兰斯创意写作测验(TTCW),将创造力作为产品来评估。TTCW由14个二元测试组成,组织为流畅性、灵活性、原创性和精细性这些原始维度。我们招募了10位创意写作者,并使用TTCW对由专业作者或LLMs撰写的48篇故事进行人工评估。我们的分析表明,LLM生成的故事通过的TTCW测试数量比专业作者撰写的故事少3到10倍。此外,我们探索了使用LLMs作为评估者来自动化TTCW评估,揭示出没有任何LLMs与专家评估呈正相关。
引用
@article{arxiv.2309.14556,
title = {Art or Artifice? Large Language Models and the False Promise of Creativity},
author = {Tuhin Chakrabarty and Philippe Laban and Divyansh Agarwal and Smaranda Muresan and Chien-Sheng Wu},
journal= {arXiv preprint arXiv:2309.14556},
year = {2024}
}
备注
ACM CHI 2024