中文

将信息抽取中的生成式语言模型评估视为主观题批改

计算与语言 2024-04-05 v1

摘要

现代大型语言模型 (LLMs) 在需要复杂认知行为的各类任务中展现出了卓越的能力。然而,我们观察到了一个矛盾的性能差异:由于传统评估中的两个问题,这些模型在关系抽取和事件抽取等看似基础的任务中表现不佳。(1)现有评估指标不够精确,难以有效衡量模型输出与真实值之间的语义一致性;(2)评估基准存在固有的不完整性,主要归因于限制性的人工标注模式,导致 LLMs 的性能被低估。受主观题批改原理的启发,我们提出了一种新的评估方法 SQC-Score。该方法创新性地利用通过主观题批改数据微调的 LLMs,来优化模型输出与黄金标签之间的匹配。此外,通过引入自然语言推理 (NLI) 模型,SQC-Score 丰富了黄金标签,通过承认正确但此前被遗漏的答案来解决基准不完整的问题。在三个信息抽取任务上的结果表明,SQC-Score 比基线指标更受人工标注者的青睐。利用 SQC-Score,我们对最先进的 LLMs 进行了全面评估,并为未来的信息抽取研究提供了见解。数据集及相关代码可在 https://github.com/THU-KEG/SQC-Score 获取。

关键词

引用

@article{arxiv.2404.03532,
  title  = {Evaluating Generative Language Models in Information Extraction as Subjective Question Correction},
  author = {Yuchen Fan and Yantao Liu and Zijun Yao and Jifan Yu and Lei Hou and Juanzi Li},
  journal= {arXiv preprint arXiv:2404.03532},
  year   = {2024}
}

备注

Accepted by LREC-COLING 2024, short paper