中文

马拉里语文档的长距离命名实体识别

计算与语言 2024-10-15 v1 机器学习

摘要

随着马拉里语数字内容的指数级增长,对高级自然语言处理 (NLP) 方法,特别是命名实体识别 (NER) 的需求日益增长。特别是,NER 对识别远距离实体和组织、理解非结构化的马拉里语文本数据至关重要。本文重点关注管理长距离实体,提供了一套全面的马拉里语文档当前 NER 技术分析。它深入探讨了当前实践,研究了 BERT 转换器模型在长距离马拉里语 NER 中的潜力。本报告分析了先前方法的有效性,还将 NER 在英文文献中的做法与马拉里语文献的比较,并建议适应策略。该论文讨论了马拉里语特定语言特征和情境细微差别所导致的困难,同时承认 NER 在 NLP 中的关键作用。为此,本项目是改进马拉里语 NER 技术的重要进展,具有潜在的更广泛应用范围覆盖 NLP 的各种任务和领域。

关键词

引用

@article{arxiv.2410.09192,
  title  = {Long Range Named Entity Recognition for Marathi Documents},
  author = {Pranita Deshmukh and Nikita Kulkarni and Sanhita Kulkarni and Kareena Manghani and Geetanjali Kale and Raviraj Joshi},
  journal= {arXiv preprint arXiv:2410.09192},
  year   = {2024}
}