中文

RideKE:面向肯尼亚代码切换语料库的情感与情绪检测中的低资源Twitter内容利用

计算与语言 2025-02-11 v1 人工智能

摘要

社交媒体已成为个人表达意见和分享经历的关键开放平台。然而,利用Twitter上的低资源语言数据具有挑战性,由于内容稀缺、质量较差,以及语言使用的主要变化,如俚语和代码切换。由于Twitter主要支持高资源语言,识别这些语言的推文可能具有挑战性。我们分析肯尼亚代码切换数据,并评估四个基于Transformer的最新预训练模型用于情感和情绪分类,采用监督和半监督方法。我们详细说明数据收集和标注的方法,以及在数据策划阶段所遇到的挑战。我们的结果表明,XLM-R优于其他模型;在情感分析中,XLM-R监督模型达到最高准确率(69.2%)和F1分数(66.1%),XLM-R半监督(67.2%准确率,64.1%F1分数)。在情绪分析中,DistilBERT监督在准确率(59.8%)和F1分数(31%)上领先,mBERT半监督(准确率(59%和F1分数26.5%)。AfriBERTa模型显示最低的准确率和F1分数。所有模型倾向于预测中性情感,Afri-BERT显示最高的偏差和对同情情绪的独特敏感性。https://github.com/NEtori21/Ride_hailing

关键词

引用

@article{arxiv.2502.06180,
  title  = {RideKE: Leveraging Low-Resource, User-Generated Twitter Content for Sentiment and Emotion Detection in Kenyan Code-Switched Dataset},
  author = {Naome A. Etori and Maria L. Gini},
  journal= {arXiv preprint arXiv:2502.06180},
  year   = {2025}
}

备注

Accepted in WASSA 2024