评估 LLMs 在波斯文学文本生成中的创造力
计算与语言
2026-02-16 v1
摘要
大型语言模型(LLMs)在生成文学作品(包括诗歌和短篇小说)方面已展现出显著的创造力。然而,先前的研究主要集中于英语,对非英语文学传统的探索有限,且缺乏评估创造力的标准化方法。在本文中,我们评估了 LLMs 生成富含文化相关表达的波斯文学文本的能力。我们构建了一个涵盖 20 个多样化主题的用户生成波斯文学数据集,并借助托兰斯创造性思维测验,从原创性、流利性、灵活性和精细性四个维度评估模型输出。为降低评估成本,我们采用 LLM 作为评判进行自动评分,并通过组内相关系数将其可靠性与人类评判进行验证,观察到高度一致。此外,我们分析了模型理解与运用四种核心文学修辞手法——明喻、暗喻、夸张和对比——的能力。我们的结果揭示了 LLMs 在波斯文学文本生成中的优势与局限,强调了进一步完善的必要性。
引用
@article{arxiv.2509.18401,
title = {Evaluating the Creativity of LLMs in Persian Literary Text Generation},
author = {Armin Tourajmehr and Mohammad Reza Modarres and Yadollah Yaghoobzadeh},
journal= {arXiv preprint arXiv:2509.18401},
year = {2026}
}