中文

面向波斯语代词消解的混合实体中心方法

计算与语言 2022-11-14 v1 人工智能 机器学习

摘要

代词消解是自然语言处理中一个称为共指消解的核心领域的一个具有挑战性的子集。共指消解旨在寻找文本中指代同一现实世界实体的所有实体。本文提出了一种混合模型,将多个基于规则的筛子与一个用于代词的机器学习筛子相结合。为此,针对波斯语设计了七个高精度的基于规则的筛子。然后,随机森林分类器将代词链接到先前的部分聚类。所提出的方法采用流水线设计,结合了机器学习与基于规则方法的优势,展现了出色的性能。该方法解决了端到端模型中的一些挑战。在本文中,作者以 400 篇文档的形式开发了一个名为 Mehr 的波斯语共指语料库。该语料库弥补了以往波斯语语料库的一些缺陷。最后,通过在 Mehr 和 Uppsala 测试集上评估所提出的方法,报告了所提出系统与波斯语早期模型相比的效率。

关键词

引用

@article{arxiv.2211.06257,
  title  = {A hybrid entity-centric approach to Persian pronoun resolution},
  author = {Hassan Haji Mohammadi and Alireza Talebpour and Ahmad Mahmoudi Aznaveh and Samaneh Yazdani},
  journal= {arXiv preprint arXiv:2211.06257},
  year   = {2022}
}

备注

27 pages