西班牙语上下文情感分类
摘要
将客户反馈分类为不同的情感类别对于理解用户情绪和改善客户体验至关重要。在本文中,我们使用先进的NLP和ML技术将西班牙语的客户反馈分类为三类情感——正面、中性、负面。传统方法将反馈从广泛使用的语言翻译为不太常见的语言,导致原始语言固有的语义完整性和语境细微差别的丢失。为解决这一局限,我们提出了一种混合方法,将TF-IDF与BERT嵌入相结合,通过使用自定义堆叠集成(CSE)方法,有效地将西班牙语文本转换为保留原始语言语义深度的丰富数值表示。为了评估情感分类,我们使用了一系列模型,包括逻辑回归、KNN、基于LGBM的Bagging分类器和AdaBoost。CSE模型将这些分类器组合为基础模型,并使用一对多逻辑回归作为元模型。我们的实验结果表明,CSE显著优于单个模型和BERT模型,在原生西班牙语数据集上达到了93.3%的测试准确率——高于从翻译版本获得的准确率。这些发现强调了西班牙语情感分类的挑战,并突显了将TF-IDF等向量化技术与BERT相结合以提高准确性的优势。我们的结果为寻求利用情感分类来增强客户反馈分析和服务改进的企业提供了宝贵的见解。
引用
@article{arxiv.2505.20571,
title = {Emotion Classification In-Context in Spanish},
author = {Bipul Thapa and Gabriel Cofre},
journal= {arXiv preprint arXiv:2505.20571},
year = {2025}
}
备注
This paper has been accepted and presented at the 4th International Conference on Applied Intelligence and Informatics (AII 2024). The final version will appear in the official conference proceedings. This preprint is provided to ensure the timely dissemination of the research prior to formal publication