面向低资源语言的词元化策略:以 Word2Vec 为例中的土耳其语和芬兰语
计算与语言
2025-09-30 v1
摘要
词元化在处理屈从语言方面发挥着关键作用,因为单个词可以编码多个形态学单元,这些单元携带语法和语义信息。本研究评估了 various tokenization strategies——包括单词级、字符级、n-gram 和字节对编码 (BPE)——对 Word2Vec 生成的静态词向量质量的影响。我们使用 10,000 篇维基百科文章构建语料库,在低资源条件下训练模型,并在命名实体识别 (NER) 任务上进行评估。尽管子词分段在理论上具有吸引力,但单词级词元化在所测试的所有词元化策略中始终优于所有替代方案。这些发现表明,在屈从语言的低资源环境中,通过单词级词元化保留边界可能比复杂的统计方法更能获得更好的词向量表现。这对开发面向资源不足语言的 NLP 流程具有实际意义,这些语言的标注数据和计算资源有限。
引用
@article{arxiv.2509.14238,
title = {Tokenization Strategies for Low-Resource Agglutinative Languages in Word2Vec: Case Study on Turkish and Finnish},
author = {Jinfan Frank Hu},
journal= {arXiv preprint arXiv:2509.14238},
year = {2025}
}
备注
6 pages, 9 figures, accepted to ACDSA 2025, to be indexed in IEEE Xplore