中文

BUSTER:一个“商业交易实体识别”数据集

计算与语言 2024-02-16 v1 机器学习

摘要

尽管自然语言处理在过去几年取得了重大突破,但将这些进展转移到实际商业案例中可能具有挑战性。原因之一在于流行基准与实际数据之间的差距。缺乏监督、类别不平衡、噪声数据和长文档常常影响金融、法律和健康等垂直领域的实际问题。为了支持工业导向的研究,我们提出了BUSTER,一个商业交易实体识别数据集。该数据集包含3779个手动标注的金融交易文档。我们建立了利用通用和领域特定语言模型的多个基线。最佳模型还用于自动标注6196个文档,我们将其作为额外的银语料库发布给BUSTER。

关键词

引用

@article{arxiv.2402.09916,
  title  = {BUSTER: a "BUSiness Transaction Entity Recognition" dataset},
  author = {Andrea Zugarini and Andrew Zamai and Marco Ernandes and Leonardo Rigutini},
  journal= {arXiv preprint arXiv:2402.09916},
  year   = {2024}
}

备注

The 2023 Conference on Empirical Methods in Natural Language Processing (EMNLP 2023), Industry Track