来自 RETEROM 项目的更多罗马尼亚语词嵌入
摘要
自动学习的词向量表示,亦称“词嵌入(word embeddings)”,正成为越来越多自然语言处理算法的基本构建模块。构建词嵌入有不同的方式与工具。多数方法依赖原始文本,构建单元为词出现项与/或字母 n-gram。更为精细的研究使用文本预处理后提取的附加语言特征。形态学显然受益于由原始文本和字母 n-gram 构建的向量表示。句法与语义研究可能更多受益于利用诸如词元、词性、与每个词关联的句法或语义依存等附加特征构建的向量表示。ReTeRom 项目的关键目标之一是开发面向罗马尼亚语自然语言处理的先进技术,包括文本的形态、句法与语义分析。为此,我们计划开发一个开放获取的大型即用词嵌入集合库,每个集合由不同参数刻画:所用特征(词形、字母 n-gram、词元、词性等)、向量长度、窗口/上下文大小与频率阈值。为此,先前在 CoRoLa 语料库上创建的词嵌入集合(基于词出现项)(Păiș and Tufiș, 2018)已经并将进一步通过使用词元与词性等特定特征从同一语料库学习的新表示加以扩充。此外,为更好地理解与探索向量,将通过定制化接口提供图形化表示。
引用
@article{arxiv.2111.10750,
title = {More Romanian word embeddings from the RETEROM project},
author = {Vasile Păiş and Dan Tufiş},
journal= {arXiv preprint arXiv:2111.10750},
year = {2021}
}
备注
Publlished in Proceedings of the 13th International Conference on Linguistic Resources and Tools for Processing Romanian Language - CONSILR 2018. Complete proceedings volume available here: https://profs.info.uaic.ro/~consilr/2019/wp-content/uploads/2019/06/volum-ConsILR-2018-1.pdf