机器学习与 emoji 预测:MARBERT 能达到什么样的准确率?
计算与语言
2026-04-27 v2 机器学习
摘要
本研究探讨了在阿拉伯推文中使用机器学习(ML)预测表情符号(emoji)的应用,采用最先进的MARBERT模型。收集了11379条代表多个阿拉伯方言的CA推文,来源于X.com,通过Python抓取。净数据集包含8695条推文,用于分析。这些推文被分类为14个类别,进行数值编码并用作标签。设计了作为可解释基准的预处理流程,以检验词汇特征与表情符号类别之间的关系。对MARBERT进行微调,以从文本输入预测表情符号的使用。我们以精确率、召回率和F1分数评估模型性能。研究结果表明,该模型在整体准确率达到0.75方面表现相当出色。本研究得出结论,尽管结果令人鼓舞,但仍需改进包括MARBERT在内的机器学习模型,特别是针对资源匮乏且方言性强的语言如阿拉伯语。
引用
@article{arxiv.2604.21108,
title = {Machine learning and emoji prediction: How much accuracy can MARBERT achieve?},
author = {Mohammed Q. Shormani and Ibrahim Abdulmalik Hassan Muneef Y. Alshawsh},
journal= {arXiv preprint arXiv:2604.21108},
year = {2026}
}
备注
15 pages, 4 Figures, 3 Tables