中文

评估命名实体识别:单语与多语言 Transformer 模型在新型巴西企业财报电话会议记录数据集上的比较分析

计算与语言 2024-09-02 v2 人工智能 机器学习

摘要

自 2018 年 Transformer 架构问世以来,自然语言处理凭借可针对各种任务进行微调的预训练 Transformer 模型获得了显著发展。大多数模型在大型英语语料库上预训练,使其不太适用于其他语言,如巴西葡萄牙语。在我们的研究中,我们确定了两个在巴西葡萄牙语上预训练的模型(BERTimbau 和 PTT5)以及两个多语言模型(mBERT 和 mT5)。BERTimbau 和 mBERT 仅使用编码器模块,而 PTT5 和 mT5 同时使用编码器和解码器。我们的研究旨在评估它们在金融命名实体识别(NER)任务上的性能,并确定微调和推理的计算需求。为此,我们开发了巴西金融 NER(BraFiNER)数据集,该数据集包含来自巴西银行财报电话会议记录的句子,并使用弱监督方法进行标注。此外,我们引入了一种新颖的方法,将令牌分类任务重构为文本生成问题。在对模型进行微调后,我们使用性能和错误指标对其进行了评估。我们的研究结果表明,基于 BERT 的模型始终优于基于 T5 的模型。虽然多语言模型表现出相当的宏观 F1 分数,但 BERTimbau 的性能优于 PTT5。在错误指标方面,BERTimbau 优于其他模型。我们还观察到 PTT5 和 mT5 生成的句子中货币和百分比值发生了变化,这凸显了金融领域准确性和一致性的重要性。我们的发现为基于 BERT 和 T5 的模型在 NER 任务上的性能差异提供了见解。

关键词

引用

@article{arxiv.2403.12212,
  title  = {Evaluating Named Entity Recognition: A comparative analysis of mono- and multilingual transformer models on a novel Brazilian corporate earnings call transcripts dataset},
  author = {Ramon Abilio and Guilherme Palermo Coelho and Ana Estela Antunes da Silva},
  journal= {arXiv preprint arXiv:2403.12212},
  year   = {2024}
}