NepEMO:面向尼泊尔语 Reddit 的多标签情感与情绪分析——语言学洞察与时间趋势
计算与语言
2025-12-30 v1
摘要
社交媒体(SM)平台(如 Facebook、Twitter 和 Reddit)日益被用于分享观点和情绪,特别是在自然灾害、大流行病和政治选举等挑战性事件期间,以及节日和庆典等欢乐场合。在各大社交媒体平台中,Reddit 为其用户提供了一个独特的空间,使其能够就健康和日常生活等敏感问题匿名表达自己的经历和想法。在本研究中,我们提出了一个名为 NepEMO 的新颖数据集,用于尼泊尔语 subreddit 帖子的多标签情绪(MLE)和情感分类(SC)。我们整理并构建了一个包含 4,462 条帖子(2019 年 1 月至 2025 年 6 月)的人工标注数据集,这些帖子以英文、罗马拼音尼泊尔语和天城文书写,涵盖五种情绪(恐惧、愤怒、悲伤、喜悦和抑郁)和三种情感类别(积极、消极和中性)。我们对帖子进行了详细分析以捕捉语言学洞察,包括情绪趋势、情绪共现、特定情感的 n-grams,以及使用 Latent Dirichlet Allocation 和 TF-IDF 关键词提取进行主题建模。最后,我们比较了用于 MLE 和 SC 任务的各种传统机器学习(ML)、深度学习(DL)和 transformer 模型。结果表明,transformer 模型在两项任务中均始终优于 ML 和 DL 模型。
引用
@article{arxiv.2512.22823,
title = {NepEMO: A Multi-Label Emotion and Sentiment Analysis on Nepali Reddit with Linguistic Insights and Temporal Trends},
author = {Sameer Sitoula and Tej Bahadur Shahi and Laxmi Prasad Bhatt and Anisha Pokhrel and Arjun Neupane},
journal= {arXiv preprint arXiv:2512.22823},
year = {2025}
}
备注
This paper is under consideration in Neural Computing & Applications (Springer) journal. This version may be deleted or updated at any time, depending on the journal's policy upon acceptance