POEMetric:人类的最后一段诗
计算与语言
2026-04-07 v1
摘要
大语言模型(LLM)可以编写诗歌,但它们离人类诗人有多远?本文介绍了 POEMetric,这是第一个全面的诗歌评估框架,检验 1)按照特定形式和主题生成诗歌的基本指令遵循能力,2)展现创造力、词汇多样性和独特性、唤起情感共鸣以及运用意象和文学手法的高级能力,3)对整首诗歌质量的整体评价和作者估计。我们精选了人类诗歌数据集——203 首符合 7 种固定形式的英文诗,标注了韵律、押韵模式和主题——并在相同的形式和主题下实验了 30 个大语言模型进行诗歌生成,总计 6,090 首 LLM 诗歌。基于 POEMetric,我们通过基于规则的评估和 LLM 作为评判家,对人类诗人和 LLM 的性能进行评估,其结果经人类专家验证。结果表明,尽管最佳模型实现了高水平的形式准确性(4.26/5.00,以 Gemini-2.5-Pro 作为评判家;以下同理)和主题对齐(4.99),但所有模型都未达到人类诗人的水平,人类诗人在创造力(4.02)、独特性(3.95)、情感共鸣(4.06)以及 skillful use of imagery(4.49)和文学手法(4.67)方面均遥遥领先。人类也在整体诗歌质量上击败了最佳 LLM(4.22 vs. 3.20)。因此,诗歌生成仍然是大语言模型的重大挑战。数据和代码已发布于 https://github.com/Bingru-Li/POEMetric。
引用
@article{arxiv.2604.03695,
title = {POEMetric: The Last Stanza of Humanity},
author = {Bingru Li and Han Wang and Hazel Wilkinson},
journal= {arXiv preprint arXiv:2604.03695},
year = {2026}
}