ChatGPT在情感计算任务上的广泛评测
人工智能
2023-08-29 v1 计算与语言
摘要
随着基础模型的兴起,一种新的人工智能范式已经出现:仅使用通用基础模型配合提示来解决各类问题,而无需为每个问题训练单独的机器学习模型。此类模型已展现出解决其初始训练未涵盖问题的涌现特性。关于此类模型有效性的研究仍相当有限。本工作中,我们广泛研究了ChatGPT模型(即GPT-4与GPT-3.5)在13个情感计算问题上的能力,包括方面抽取、方面极性分类、观点抽取、情感分析、情感强度排序、情绪强度排序、自杀倾向检测、毒性检测、幸福感评估、参与度测量、人格评估、讽刺检测与主观性检测。我们引入一种框架,通过将回归类问题(如强度排序问题)建模为成对排序分类,来评测ChatGPT模型在上述问题上的表现。我们将ChatGPT与更传统的NLP方法(如端到端循环神经网络与transformers)进行比较。结果表明ChatGPT模型在广泛的情感计算问题上具有涌现能力,其中GPT-3.5尤其是GPT-4在许多问题上表现出色,特别是与情感、情绪或毒性相关的问题。ChatGPT模型在具有隐式信号的问题(如参与度测量与主观性检测)上表现欠佳。
引用
@article{arxiv.2308.13911,
title = {A Wide Evaluation of ChatGPT on Affective Computing Tasks},
author = {Mostafa M. Amin and Rui Mao and Erik Cambria and Björn W. Schuller},
journal= {arXiv preprint arXiv:2308.13911},
year = {2023}
}
备注
8 pages with references, 2 tables