中文

面向低资源印度语言跨语言事实抽取的大规模多语言模型

计算与语言 2023-02-10 v1 人工智能 信息检索

摘要

Wikidata 等大规模知识图谱试图捕获关于多个实体的世界知识。近期方法集中于从文本中自动丰富这些 KG。然而,大量以低资源语言自然语言文本形式存在的信息常被遗漏。跨语言信息抽取旨在从低资源印度语言文本中抽取以英文三元组形式的事实信息。尽管潜力巨大,该任务相较于单语信息抽取进展滞后。本文提出从文本中进行跨语言事实抽取(CLFE)的任务,并设计了一种端到端生成式方法,其取得了 77.46 的总体 F1 分数。

关键词

引用

@article{arxiv.2302.04790,
  title  = {Massively Multilingual Language Models for Cross Lingual Fact Extraction from Low Resource Indian Languages},
  author = {Bhavyajeet Singh and Pavan Kandru and Anubhav Sharma and Vasudeva Varma},
  journal= {arXiv preprint arXiv:2302.04790},
  year   = {2023}
}

备注

5 pages, 2 page Apendix, 3 figures, accepted at 19th International Conference on Natural Language Processing