中文

ChatGPT:样样通,样样松

计算与语言 2023-06-13 v4 人工智能 计算机与社会 机器学习

摘要

OpenAI 发布了 Chat Generative Pre-trained Transformer(ChatGPT),并革新了人工智能中人与模型交互的方式。已有若干关于 ChatGPT 评估的文献测试了其在知名自然语言处理(NLP)任务上的有效性。然而,现有研究大多为非自动化且在非常有限的规模上测试。在本工作中,我们考察了 ChatGPT 在 25 项多样化分析型 NLP 任务上的能力,其中多数任务即便对人类而言也是主观的,例如情感分析、情绪识别、攻击性检测和立场检测。相比之下,其他任务需要更客观的推理,如词义消歧、语言可接受性和问答。我们还在五个选定的 NLP 任务子集上评估了 GPT-4 模型。我们对 ChatGPT 和 GPT-4 的提示过程进行了自动化,并分析了超过 49k 条响应。将其结果与可用的 State-of-the-Art(SOTA)方案比较表明,ChatGPT 模型在零样本和少样本评估中的平均质量损失约为 25%。对于 GPT-4 模型,语义任务的损失显著低于 ChatGPT。我们表明,任务越困难(SOTA 性能越低),ChatGPT 损失越高。这尤其适用于像情绪识别这样的语用 NLP 问题。我们还通过随机上下文少样本个性化测试了 ChatGPT 对选定主观任务的响应个性化能力,并获得了显著更好的基于用户的预测。额外的定性分析揭示了 ChatGPT 的偏差,很可能是由于 OpenAI 施加给人类训练者的规则所致。我们的结果为一场基础性讨论提供了基础:近期预测型 NLP 模型的高质量是否就能表明某工具对社会的有用性,以及此类系统的学习和验证流程应如何建立。

关键词

引用

@article{arxiv.2302.10724,
  title  = {ChatGPT: Jack of all trades, master of none},
  author = {Jan Kocoń and Igor Cichecki and Oliwier Kaszyca and Mateusz Kochanek and Dominika Szydło and Joanna Baran and Julita Bielaniewicz and Marcin Gruza and Arkadiusz Janz and Kamil Kanclerz and Anna Kocoń and Bartłomiej Koptyra and Wiktoria Mieleszczenko-Kowszewicz and Piotr Miłkowski and Marcin Oleksy and Maciej Piasecki and Łukasz Radliński and Konrad Wojtasik and Stanisław Woźniak and Przemysław Kazienko},
  journal= {arXiv preprint arXiv:2302.10724},
  year   = {2023}
}

备注

preprint