中文

评估 ChatGPT 的信息抽取能力:性能、可解释性、校准度与忠实度的考察

计算与语言 2023-04-25 v1

摘要

诸如 ChatGPT 之类的大语言模型(LLMs)理解用户意图并提供合理回复的能力使其近来极受欢迎。在本文中,我们聚焦于使用 7 项细粒度信息抽取(IE)任务评估 ChatGPT 的综合能力。特别地,我们通过衡量 ChatGPT 的性能、可解释性、校准度和忠实度进行系统分析,并从 ChatGPT 或领域专家角度得出 15 个关键发现。我们的结果表明,ChatGPT 在 Standard-IE 设定下性能较差,但令人惊讶的是,在 OpenIE 设定下表现出优异性能(经人工评估证实)。此外,我们的研究表明 ChatGPT 为其决策提供了高质量且可信的解释。然而,存在 ChatGPT 对其预测过度自信而导致校准度低的问题。进一步地,ChatGPT 在大多数情况下对原文表现出高度的忠实度。我们人工标注并发布了包含 14 个数据集的 7 项细粒度 IE 任务的测试集,以进一步推动相关研究。数据集与代码见 https://github.com/pkuserc/ChatGPT_for_IE。

关键词

引用

@article{arxiv.2304.11633,
  title  = {Evaluating ChatGPT's Information Extraction Capabilities: An Assessment of Performance, Explainability, Calibration, and Faithfulness},
  author = {Bo Li and Gexiang Fang and Yang Yang and Quansen Wang and Wei Ye and Wen Zhao and Shikun Zhang},
  journal= {arXiv preprint arXiv:2304.11633},
  year   = {2023}
}