一种识别孟加拉语名词 - 名词复合多词表达式的机器学习方法
计算与语言
2014-01-28 v1 机器学习
摘要
本文提出了一种用于识别作为双词名词复合词的孟加拉语多词表达式 (MWE) 的机器学习方法。我们提出的方法包含两个步骤:(1) 利用组块信息和各种启发式规则进行候选提取;(2) 训练名为 Random Forest 的机器学习算法,将候选词分类为双词名词复合 MWE 或非双词名词复合 MWE 两类。我们的 MWE 识别任务使用了多种关联度量、句法和语言线索以及一组基于 WordNet 的相似性特征。本文提出的方法可用于识别孟加拉语运行文本中的双词名词复合 MWE。
引用
@article{arxiv.1401.6567,
title = {A Machine Learning Approach for the Identification of Bengali Noun-Noun Compound Multiword Expressions},
author = {Vivekananda Gayen and Kamal Sarkar},
journal= {arXiv preprint arXiv:1401.6567},
year = {2014}
}