小型语言模型在短篇创意写作中超越人类:一种比较SLMs与人类和LLMs的研究
计算与语言
2025-06-05 v2 人工智能
摘要
本文评估了经微调的小型语言模型(SLM)BART-large的创意小说写作能力,并将其性能与人类作家和两种大型语言模型(LLMs)进行比较。我们的评估包括两个实验:(i)人类研究,其中68名参与者对来自人类和SLM的短篇小说进行语法性、相关性、创造性和吸引力的评分;(ii)考察每种模型产出文本特征的定性语言分析。在第一个实验中,BART-large整体上超过平均人类作家(2.11 vs. 1.85),实现了14%的相对提升,尽管在创造性方面略微占据人类优势但未达统计学显著。第二个实验中,定性分析显示,尽管GPT-4o表现出近乎完美的连贯性并使用较少的陈词滥调短语,但它倾向于产生更可预测的语言,其中仅3%的 synopsis 包含令人惊讶的关联(相对于BART的15%)。这些发现突显了模型规模和微调对创意写作任务中创造力、流畅性和连贯性之间平衡的影响,证明了在特定情境下,较小的模型可以与人类和较大模型一样优秀。
引用
@article{arxiv.2409.11547,
title = {Small Language Models can Outperform Humans in Short Creative Writing: A Study Comparing SLMs with Humans and LLMs},
author = {Guillermo Marco and Luz Rello and Julio Gonzalo},
journal= {arXiv preprint arXiv:2409.11547},
year = {2025}
}
备注
Accepted as Main Conference Paper at COLING 2025