DictaBERT:面向现代希伯来语的先进 BERT 套件
计算与语言
2023-10-16 v2
摘要
我们提出 DictaBERT,一种面向现代希伯来语的新先进预训练 BERT 模型,在大多数基准上优于现有模型。此外,我们发布该模型的三个微调版本,旨在执行希伯来语文本分析中的三项基础任务:前缀分割、形态标注与问答。这些微调模型使任何开发者仅需单次调用 HuggingFace 模型即可完成希伯来语输入的前缀分割、形态标注与问答,无需集成任何额外库或代码。本文描述了训练细节及各基准上的结果。我们向社区发布这些模型及演示其用法的示例代码。发布这些模型是我们旨在推动希伯来语 NLP 研究与开发之目标的一部分。
引用
@article{arxiv.2308.16687,
title = {DictaBERT: A State-of-the-Art BERT Suite for Modern Hebrew},
author = {Shaltiel Shmidman and Avi Shmidman and Moshe Koppel},
journal= {arXiv preprint arXiv:2308.16687},
year = {2023}
}
备注
Updated second version, with links to two question-answering models