科普特语穷尽式实体识别:挑战与对策
计算与语言
2020-11-05 v1 数字图书馆
摘要
实体识别在数字人文中为古代文献提供了语义访问途径:它揭示了无法被通读的文本中所关注的人物与地点,便于资源链接,并可为即便无译文的文本提供内容窗口。本文提出针对科普特语(希腊化时期埃及的语言)的实体识别。我们评估了面向该任务的 NLP 方法,并阐明了将其应用于低资源、形态复杂语言时所面临的困难。我们提出了命名与非命名嵌套实体识别以及面向 Wikipedia 的半自动实体链接方案,依托鲁棒依存句法分析、基于特征的 CRF 模型以及手工构建的知识库资源,从而以比高资源语言少数个数量级的数据实现高精度 NER。结果指出了在类似环境下其他语言的研究路径。
引用
@article{arxiv.2011.02068,
title = {Exhaustive Entity Recognition for Coptic: Challenges and Solutions},
author = {Amir Zeldes and Lance Martin and Sichang Tu},
journal= {arXiv preprint arXiv:2011.02068},
year = {2020}
}
备注
9 pages, 2 figures, 5 tables. Accepted by The 4th Joint SIGHUM Workshop on Computational Linguistics for Cultural Heritage, Social Sciences, Humanities and Literature