对 ChatGPT 在推理、幻觉与交互性方面的多任务、多语言、多模态评测
计算与语言
2023-11-29 v4 人工智能
摘要
本文提出一种利用公开数据集对 ChatGPT 等交互式大语言模型(LLM)进行定量评测的框架。我们使用涵盖 8 种不同常见自然语言处理(NLP)应用任务的 23 个数据集对 ChatGPT 进行了广泛的技术评测。基于这些数据集及一个新设计的多模态数据集,我们评估了 ChatGPT 的多任务、多语言与多模态特性。我们发现,ChatGPT 在大多数任务上优于采用零样本学习的 LLM,甚至在部分任务上优于微调模型。我们发现其理解非拉丁字母语言的能力优于生成此类语言的能力。它能够通过中间代码生成步骤从文本提示生成多模态内容。此外,我们发现 ChatGPT 在逻辑推理、非文本推理与常识推理下的 10 个不同推理类别中平均准确率为 63.41%,因此并非可靠的推理器。例如,其演绎推理能力优于归纳推理。ChatGPT 与其他 LLM 一样存在幻觉问题,并且由于其无法访问外部知识库,会从参数化记忆中产生更多的外在幻觉。最后,ChatGPT 的交互特性使人能够与底层 LLM 协作,通过多轮“提示工程”方式提升其性能,即摘要任务上 ROUGE-1 提升 8%,机器翻译任务上 ChrF++ 提升 2%。我们还发布了用于评测集提取的代码库。
引用
@article{arxiv.2302.04023,
title = {A Multitask, Multilingual, Multimodal Evaluation of ChatGPT on Reasoning, Hallucination, and Interactivity},
author = {Yejin Bang and Samuel Cahyawijaya and Nayeon Lee and Wenliang Dai and Dan Su and Bryan Wilie and Holy Lovenia and Ziwei Ji and Tiezheng Yu and Willy Chung and Quyet V. Do and Yan Xu and Pascale Fung},
journal= {arXiv preprint arXiv:2302.04023},
year = {2023}
}
备注
45 pages, AACL 2023