中文

葡萄牙语事件抽取:一种基于 ACE-2005 的 QA 驱动方法

计算与语言 2024-09-02 v1 人工智能

摘要

事件抽取是一项信息检索任务,通常包括识别事件的中心词(触发词)和事件的论元。这项任务在英语上已被广泛研究,但在葡萄牙语上却相对滞后,部分原因是缺乏特定任务的标注语料库。本文提出了一个框架,其中两个独立的基于 BERT 的模型被微调用于识别和分类葡萄牙语文档中的事件。我们将此任务分解为两个子任务。首先,我们使用一个词元分类模型来检测事件触发词。为了抽取事件论元,我们训练了一个问答模型,该模型向触发词查询其对应的事件论元角色。鉴于葡萄牙语中缺乏事件标注语料库,我们将原始版本的 ACE-2005 数据集(该领域的参考基准)翻译成葡萄牙语,生成了一个新的葡萄牙语事件抽取语料库。为此,我们开发了一个自动翻译流水线。我们的框架在触发词分类和论元分类上分别获得了 64.4 和 46.7 的 F1 分数,从而为葡萄牙语的这些任务设定了新的 SOTA 参考基准。

关键词

引用

@article{arxiv.2408.16932,
  title  = {Event Extraction for Portuguese: A QA-driven Approach using ACE-2005},
  author = {Luís Filipe Cunha and Ricardo Campos and Alípio Jorge},
  journal= {arXiv preprint arXiv:2408.16932},
  year   = {2024}
}