LLM 是否在评估替代用途的创意时达成一致?
人工智能
2024-11-27 v2 计算与语言
摘要
本文探讨了大型语言模型 (LLM) 在评估替代用途测试 (Alternative Uses Test, AUT) 中创意输出时的一致性问题。尽管 LLM 正在越来越多地用于评估创意内容,但以往的研究主要聚焦于单一模型评估由同一模型或人类生成的输出。本文探索了 LLM 是否能够公正且准确地评估由自身及其他模型生成的创意输出。我们使用一套作为参考基准的 AUT 响应数据集,将其按创意水平 (常见、创意和高度创意) 进行分类,对四个最先进的 LLM 进行评估实验。我们测试了评分和排序方法,并采用两种评估设置 (全面和分段) 以检验 LLM 是否在替代用途的创意评估方面达成一致。结果显示,跨模型间的一致性很高,Spearman 相关系数在各模型间平均超过 0.7,相对于参考基准可达到 0.77以上,表明一致性很高,验证了 LLM 在替代用途创意评估中的可靠性。值得注意的是,模型并不偏好自身生成的输出,而是为由其他模型生成的替代用途提供相似的创意评分或排序。这些发现表明 LLM 在创意评估中表现出公正性和高度一致性,为其在自动化创意评估中的应用提供了广泛前景。
引用
@article{arxiv.2411.15560,
title = {Do LLMs Agree on the Creativity Evaluation of Alternative Uses?},
author = {Abdullah Al Rabeyah and Fabrício Góes and Marco Volpe and Talles Medeiros},
journal= {arXiv preprint arXiv:2411.15560},
year = {2024}
}
备注
19 pages, 7 figures, 15 tables