中文

低资源多语言数据上的公共交通用户情感分析

计算与语言 2024-12-11 v1 机器学习

摘要

许多撒哈拉以南非洲国家的公共交通系统相比其他领域往往受到较少关注,这凸显了需要创新方案来提升服务质量(QoS)和整体用户体验。本研究探索了通勤者观点挖掘,以了解肯尼亚、坦桑尼亚和南非现有公共交通系统的用户情感。我们采用定性研究设计,分析来自 X(原 Twitter)的数据,评估铁路、小型巴士出租车和公交车方面的情感。通过利用多语言观点挖掘技术,我们应对了数据集中存在的语言多样性和代码切换现象,从而展示了自然语言处理(NLP)在从资源匮乏语言中提取洞察方面的应用。我们采用了 AfriBERTa、AfroXLMR、AfroLM 和 PuoBERTa 等预训练语言模型进行情感分析。结果显示南非和肯尼亚的情感以负面为主,而坦桑尼亚数据集的情感主要为正面,这归因于推文的广告性质。此外,使用 Word2Vec 模型和 K-Means 聚类进行特征提取,揭示了不同数据集中存在的语义关系和主要主题。通过优先分析用户体验和情感,本研究为开发更具响应性、以用户为中心的撒哈拉以南非洲公共交通系统铺平了道路,为改善城市出行和可持续发展的更广泛目标做出贡献。

关键词

引用

@article{arxiv.2412.06951,
  title  = {Analysing Public Transport User Sentiment on Low Resource Multilingual Data},
  author = {Rozina L. Myoya and Vukosi Marivate and Idris Abdulmumin},
  journal= {arXiv preprint arXiv:2412.06951},
  year   = {2024}
}