大语言模型能在诗歌评估中超越非专家吗?一项基于共识评估技术的比较研究
计算与语言
2025-10-07 v2
摘要
本研究将共识评估技术(CAT)适配于大语言模型(LLM),引入了一种诗歌评估的新方法。利用一个包含90首诗的数据集,以发表 venue 作为真实标准,我们证明该方法使LLM能够显著超越非专家人类评判者的表现。我们的方法利用小规模随机批次内的强制选择排序,使Claude-3-Opus实现了与真实标准的斯皮尔曼等级相关系数0.87,大幅超越最佳非专家人类评估(SRC = 0.38)。LLM评估还表现出高评分者间信度,强调了该方法的稳健性。这些发现确立了LLM在比较框架引导下可以成为评估诗歌的有效且可靠的工具,为其在其他创意领域的更广泛应用铺平了道路。
引用
@article{arxiv.2502.19064,
title = {Can Large Language Models Outperform Non-Experts in Poetry Evaluation? A Comparative Study Using the Consensual Assessment Technique},
author = {Piotr Sawicki and Marek Grześ and Dan Brown and Fabrício Góes},
journal= {arXiv preprint arXiv:2502.19064},
year = {2025}
}
备注
18 pages, 3 figures. Accepted for publication at the 2025 Conference on Empirical Methods in Natural Language Processing (EMNLP)