中文

艺术还是伪作?大型语言模型与创造力的虚假承诺

计算与语言 2024-03-11 v3 人工智能 人机交互

摘要

研究者认为大型语言模型(LLMs)从博客到故事都展现出高质量的写作能力。然而,客观评估一篇写作的创造性是具有挑战性的。受将创造力作为过程来测量的托兰斯创造性思维测验(TTCT)启发,我们利用共识评估技术[3]并提出托兰斯创意写作测验(TTCW),将创造力作为产品来评估。TTCW由14个二元测试组成,组织为流畅性、灵活性、原创性和精细性这些原始维度。我们招募了10位创意写作者,并使用TTCW对由专业作者或LLMs撰写的48篇故事进行人工评估。我们的分析表明,LLM生成的故事通过的TTCW测试数量比专业作者撰写的故事少3到10倍。此外,我们探索了使用LLMs作为评估者来自动化TTCW评估,揭示出没有任何LLMs与专家评估呈正相关。

关键词

引用

@article{arxiv.2309.14556,
  title  = {Art or Artifice? Large Language Models and the False Promise of Creativity},
  author = {Tuhin Chakrabarty and Philippe Laban and Divyansh Agarwal and Smaranda Muresan and Chien-Sheng Wu},
  journal= {arXiv preprint arXiv:2309.14556},
  year   = {2024}
}

备注

ACM CHI 2024