非上下文 BERT 还是 FastText?一个比较分析
计算与语言
2025-02-21 v3 机器学习
摘要
针对缺乏大型标注数据集的低资源语言的自然语言处理 (NLP) 面临着显著挑战,这些语言缺乏高质量数据和语言资源。嵌入选择在实现强大的 NLP 任务性能方面起着关键作用。虽然上下文 BERT 嵌入需要完整的前向传递,但非上下文 BERT 嵌入仅依赖表查找。现有研究主要关注上下文 BERT 嵌入,使非上下文嵌入鲜有探讨。在本研究中,我们分析了来自 BERT 模型 (MuRIL 和 MahaBERT) 和 FastText 模型 (IndicFT 和 MahaFT) 的非上下文嵌入在新闻分类、情感分析和仇恨言论检测等任务上的有效性,这些任务针对一种低资源语言——马拉里语。我们将这些嵌入与其上下文和压缩变体进行比较。我们的发现表明,来自 BERT 模型第一个嵌入层提取的非上下文 BERT 嵌入优于 FastText 嵌入,为低资源 NLP 提出了有前景的替代方案。
引用
@article{arxiv.2411.17661,
title = {Non-Contextual BERT or FastText? A Comparative Analysis},
author = {Abhay Shanbhag and Suramya Jadhav and Amogh Thakurdesai and Ridhima Sinare and Raviraj Joshi},
journal= {arXiv preprint arXiv:2411.17661},
year = {2025}
}