大语言模型是否是语料级事件关系抽取的优质标注者?
计算与语言
2025-02-25 v3 人工智能
摘要
大型语言模型(LLM)在自然语言处理任务中展现出广泛的能力,但其在语料级事件关系抽取(ERE)任务中的有效性尚未探讨。本文评估了大型语言模型在处理以长文档和涉及指代、时间、因果及子事件等类型复杂关系为特征的语料级 ERE 任务时的表现。实验使用商业模型 GPT-3.5 和开源模型 LLaMA-2 进行评估。我们的研究发现,大型语言模型在与通过监督学习建立的基线相比时表现显著不足。尽管监督微调(SFT)可以提升大型语言模型的性能,但其规模化效果不如较小的监督基线模型。我们的定量和定性分析表明,在用于抽取事件关系时,大型语言模型存在若干弱点,包括倾向于虚构事件mention、未能捕捉关系中的传递性规则、检测长距离关系或理解密集事件mention的上下文环境。代码地址:https://github.com/WeiKangda/LLM-ERE.git。
引用
@article{arxiv.2407.19568,
title = {Are LLMs Good Annotators for Discourse-level Event Relation Extraction?},
author = {Kangda Wei and Aayush Gautam and Ruihong Huang},
journal= {arXiv preprint arXiv:2407.19568},
year = {2025}
}