面向大规模事件抽取:基于 LLM 的协作标注与分区抽取
计算与语言
2025-03-05 v1 人工智能
摘要
开发能够抽取大规模事件类型的通用抽取系统是事件抽取 (EE) 中的长期目标。实现这一目标面临两个挑战:1) 缺乏有效且高效的标注方法;2) 缺乏能处理大规模事件类型的强大抽取方法。针对第一个挑战,我们提出了一种基于大型语言模型 (LLM) 的协作标注方法。通过多个 LLM 之间的协作,首先从远期监督中细化触发词的标注,然后进行论元标注。随后,进行投票阶段,将不同 LLM 中的标注偏好加以整合。最后,我们创建了 EEMT 数据集,这是目前规模最大的 EE 数据集,包含超过 20 万个样本、3465 个事件类型和 6297 个角色类型。针对第二个挑战,我们提出了一种称为 LLM-PEE 的 LLM 基于分区的事件抽取方法。为克服 LLM 局限于上下文长度的限制,LLM-PEE 首先召回候选事件类型,然后将其划分为多个分区供 LLM 抽取事件。监督设置下的实验结果表明,LLM-PEE 在事件检测和论元抽取方面分别超过最新方法 5.4 和 6.1 个百分点。在零样本设置下,LLM-PEE 相较于主流 LLM 实现了最高 12.9 的提升,显示现其强大的泛化能力。
引用
@article{arxiv.2503.02628,
title = {Towards Event Extraction with Massive Types: LLM-based Collaborative Annotation and Partitioning Extraction},
author = {Wenxuan Liu and Zixuan Li and Long Bai and Yuxin Zuo and Daozhu Xu and Xiaolong Jin and Jiafeng Guo and Xueqi Cheng},
journal= {arXiv preprint arXiv:2503.02628},
year = {2025}
}
备注
Work in progress