GPT能否取代人类评估者?基于机器生成隐喻规范的效度与可靠性评估
计算与语言
2025-12-16 v1
摘要
随着大型语言模型(LLM)在科学研究中日益被使用,其可信度问题变得至关重要。在心理语言学中,LLM最近被用于自动扩展人类评估数据集,针对单个单词的生成评估已取得鼎舞成果。然而,针对复杂项目(即隐喻)的评估效果仍未探索。本文首次评估了使用三个GPT模型为来自意大利隐喻档案馆以及三个英文研究收集的687个隐喻项目,生成的熟悉度、可理解性和可映像性评估的有效性和可靠性。我们就人类数据对齐性以及预测行为和电生理响应的能力进行了彻底的验证。我们发现,机器生成的评估与人类生成的评估呈正相关。熟悉度评估在英文和意大利隐喻中均达到中等至强相关,尽管对于高感官运动负荷的隐喻相关性减弱。可映像性在英文中显示中等相关,在意大利中显示中等至强相关。英文隐喻的可理解性表现出最强的相关性。总体而言,较大的模型表现更好,随着熟悉度和可映像性,人类-模型之间的不一致性更大。机器生成的评估显著预测了反应时间和EEG振幅,其强度相当于人类评估。此外,跨独立会话获得的GPT评估高度稳定。我们得出结论,特别是较大的GPT模型,可以有效且可靠地取代或增强人类受试者对隐喻属性进行评估。然而,LLM在处理隐喻意义的惯用性和多模态方面与人类的对齐性较差,这需要对刺激性质进行小心考虑。
引用
@article{arxiv.2512.12444,
title = {Can GPT replace human raters? Validity and reliability of machine-generated norms for metaphors},
author = {Veronica Mangiaterra and Hamad Al-Azary and Chiara Barattieri di San Pietro and Paolo Canal and Valentina Bambini},
journal= {arXiv preprint arXiv:2512.12444},
year = {2025}
}
备注
30 pages, 5 figures