中文

L3Cube-MahaSocialNER:基于社交媒体的马拉地语命名实体识别数据集与BERT模型

计算与语言 2024-02-15 v1 机器学习

摘要

这项工作介绍了L3Cube-MahaSocialNER数据集,这是第一个也是最大的专门为马拉地语命名实体识别(NER)设计的社交媒体数据集。该数据集包含18,000个手动标注的句子,涵盖八种实体类别,解决了社交媒体数据带来的挑战,包括非标准语言和非正式习语。在带有IOB和非IOB标注的单个数据集上评估了深度学习模型,包括CNN、LSTM、BiLSTM和Transformer模型。结果证明了这些模型在准确识别马拉地语非正式文本中的命名实体方面的有效性。L3Cube-MahaSocialNER数据集提供了以用户为中心的信息提取,并支持实时应用,为社交媒体平台上的公众意见分析、新闻和营销提供了宝贵资源。我们还表明,常规NER模型在社交NER测试集上的零样本结果很差,从而突出了对更多社交NER数据集的需求。数据集和模型公开在https://github.com/l3cube-pune/MarathiNLP。

关键词

引用

@article{arxiv.2401.00170,
  title  = {L3Cube-MahaSocialNER: A Social Media based Marathi NER Dataset and BERT models},
  author = {Harsh Chaudhari and Anuja Patil and Dhanashree Lavekar and Pranav Khairnar and Raviraj Joshi},
  journal= {arXiv preprint arXiv:2401.00170},
  year   = {2024}
}

备注

Accepted at Forum for Information Retrieval Evaluation (FIRE 2023)