中文

LSCP:增强的大规模口语波斯语语言理解

计算与语言 2020-06-03 v1 人工智能 信息检索 机器学习

摘要

近年来,借助深度学习和具有丰富标注的基准等现代机器学习方法,语言识别取得了显著进展。然而,研究在低资源正式语言方面仍然有限。这在描述口语方面存在显著差距,尤其是对于像波斯语这样的低资源语言。为了针对低资源语言的这一差距,我们提出了“大规模口语波斯语数据集”(LSCP)。LSCP 以语义分类法分层组织,聚焦于多任务非正式波斯语语言理解这一综合问题。它涵盖了对人类级句子多重语义方面的识别,这些句子自然取自真实世界语句。我们相信,进一步的调查与处理,以及新颖算法和方法的应用,能够加强低资源语言的计算机化理解与处理。所提出的语料库由 1.2 亿个句子组成,源自 2700 万条推文,标注有解析树、词性标签、情感极性和五种不同语言的翻译。

关键词

引用

@article{arxiv.2003.06499,
  title  = {LSCP: Enhanced Large Scale Colloquial Persian Language Understanding},
  author = {Hadi Abdi Khojasteh and Ebrahim Ansari and Mahdi Bohlouli},
  journal= {arXiv preprint arXiv:2003.06499},
  year   = {2020}
}

备注

6 pages, 2 figures, 3 tables, Accepted at the 12th International Conference on Language Resources and Evaluation (LREC 2020)