ViGoEmotions:面向越南语文本细粒度情感检测的基准数据集
计算与语言
2026-03-27 v2
摘要
情感分类在情感预测和有害内容检测中扮演着重要角色。自然语言处理(NLP)的最新进展,特别是通过大语言模型(LLM),极大地改善了该领域的结果。本研究介绍了 ViGoEmotions——一个包含 20,664 条社交媒体评论的越南语情感语料库,其中每条评论被分类为 27 种细粒度的不同情感。为了评估数据集的质量及其对情感分类的影响,我们在三种预处理策略下评估了八个基于预训练 Transformer 的模型:保留原始表情符号并进行基于规则的规范化、将表情符号转换为文本描述,以及应用基于模型的词汇规范化系统 ViSoLex。结果表明,将表情符号转换为文本通常会提高几个基于 BERT 的基线的性能,而保留表情符号则为 ViSoBERT 和 CafeBERT 带来了最佳结果。相比之下,移除表情符号通常会导致性能下降。ViSoBERT 取得了最高的 Macro F1 分数 61.50% 和 Weighted F1 分数 63.26%。CafeBERT 和 PhoBERT 也表现出强劲的性能。这些发现强调,虽然所提出的语料库可以有效支持多样化的架构,但预处理策略和标注质量仍然是影响下游性能的关键因素。
引用
@article{arxiv.2602.08371,
title = {ViGoEmotions: A Benchmark Dataset For Fine-grained Emotion Detection on Vietnamese Texts},
author = {Hung Quang Tran and Nam Tien Pham and Son T. Luu and Kiet Van Nguyen},
journal= {arXiv preprint arXiv:2602.08371},
year = {2026}
}
备注
Accepted as main paper at EACL 2026