评估ChatGPT作为问答系统:与现有模型的全面分析和比较
计算与语言
2023-12-14 v1 人工智能
摘要
在当前时代,出现了大量语言模型来满足用户查询。值得注意的是,GPT-3.5 Turbo语言模型作为ChatGPT的底层技术获得了广泛关注。利用大量参数,该模型能够熟练地回答各种问题。然而,由于依赖内部知识,回答的准确性可能并非绝对。本文审视了ChatGPT作为问答系统(QAS)的表现,并将其与其他现有QAS进行了比较。主要关注评估ChatGPT从给定段落中提取回答的能力,这是QAS的核心能力。此外,还在没有上下文段落的情况下进行了性能比较。在ChatGPT上进行了多项实验,探索回答幻觉并考虑问题复杂性。评估使用了著名的问答数据集,包括SQuAD、NewsQA和PersianQuAD,涵盖英语和波斯语。评估中采用了F值、精确匹配和准确率等指标。研究表明,虽然ChatGPT作为生成模型表现出色,但在问答方面不如任务特定模型有效。提供上下文可改善其性能,提示工程可提高精度,特别是对于在给定段落中没有明确答案的问题。与“如何”和“为什么”类型的问题相比,ChatGPT在简单事实性问题上的表现更优。评估突出了幻觉现象,即ChatGPT对在给定上下文中没有可用答案的问题给出回答。
引用
@article{arxiv.2312.07592,
title = {Evaluating ChatGPT as a Question Answering System: A Comprehensive Analysis and Comparison with Existing Models},
author = {Hossein Bahak and Farzaneh Taheri and Zahra Zojaji and Arefeh Kazemi},
journal= {arXiv preprint arXiv:2312.07592},
year = {2023}
}
备注
15 pages, 7 figures