评估GPT-4在情感评价标注中的可靠性与有效性
计算与语言
2025-03-25 v2
摘要
情感评价理论认为,情绪源于对事件的主观评估,称为评价。评价学科相当多样,通常以Likert量表形式给出评分,以便在体验标注者或读者标注者范式中进行标注。本文研究GPT-4作为21种特定评价评分的读者标注者,探讨不同提示设置下的表现,以评估其性能并改进其性能。我们发现GPT-4是一种有效的读者标注者,其表现接近甚至略优于人类标注者,其结果可通过五次完成的多数投票显著改善。GPT-4也能有效地使用单个提示预测评价评分和情绪标签,但增加指令复杂度会导致性能下降。我们还发现,较长的事件描述对模型和人类标注者的评分都更准确。本工作为LLM在心理学领域的应用以及改进GPT-4在评价标注中性能的策略做出了贡献。
引用
@article{arxiv.2503.16883,
title = {Assessing the Reliability and Validity of GPT-4 in Annotating Emotion Appraisal Ratings},
author = {Deniss Ruder and Andero Uusberg and Kairit Sirts},
journal= {arXiv preprint arXiv:2503.16883},
year = {2025}
}
备注
CLPsych 2025