中文

在输入扰动下 ChatGPT 的信息抽取预测有多可靠?

计算与语言 2024-04-09 v1

摘要

本文评估了在输入扰动下 ChatGPT 在信息抽取(IE)最基础任务之一即命名实体识别(NER)上的鲁棒性(可靠性)。尽管备受关注且多数研究者认可其语言理解与生成能力,但对其鲁棒性的关注甚少:输入扰动如何影响 1)预测结果,2)预测置信度,以及 3)预测背后解释的质量。我们在两个 NER 数据集上,通过自动评估与人工评估,对 ChatGPT 在零样本与少样本设置下的鲁棒性进行了系统分析。基于自动评估指标,我们发现:1)相较于对广为人知的人物或地点实体的扰动,ChatGPT 在药物或疾病替换(罕见实体)上更为脆弱;2)在不同类型的“实体特定”与“上下文特定”扰动下,同一实体的解释质量存在显著差异,而通过上下文学习可显著提升该质量;3)其对大多数错误预测表现出过度自信,因此可能对终端用户产生误导。

关键词

引用

@article{arxiv.2404.05088,
  title  = {How much reliable is ChatGPT's prediction on Information Extraction under Input Perturbations?},
  author = {Ishani Mondal and Abhilasha Sancheti},
  journal= {arXiv preprint arXiv:2404.05088},
  year   = {2024}
}

备注

3 Figures, 7 Tables