中文

XLEnt:基于词法-语义-语音词对齐挖掘大型跨语言实体数据集

计算与语言 2021-09-13 v2

摘要

跨语言命名实体词典是机器翻译和跨语言维基化等多语言 NLP 任务的重要资源。尽管知识库包含大量高资源语言(如英语和法语)的实体,但低资源语言对应的实体常常缺失。为此,我们提出词法-语义-语音对齐(LSP-Align),一种从挖掘的网页数据中自动挖掘跨语言实体词典的技术。我们证明 LSP-Align 在抽取跨语言实体对上优于基线方法,并从与英语对齐的 120 种不同语言中挖掘出 1.64 亿个实体对。我们将这些跨语言实体对与大规模多语言带标注命名实体语料库作为资源发布给 NLP 社区。

关键词

引用

@article{arxiv.2104.08597,
  title  = {XLEnt: Mining a Large Cross-lingual Entity Dataset with Lexical-Semantic-Phonetic Word Alignment},
  author = {Ahmed El-Kishky and Adithya Renduchintala and James Cross and Francisco Guzmán and Philipp Koehn},
  journal= {arXiv preprint arXiv:2104.08597},
  year   = {2021}
}