面向Sinhala、English及代码混合内容的多语言情感分析可解释性提升
计算与语言
2025-04-21 v1 人工智能
机器学习
摘要
情感分析在银行行业品牌声誉管理中至关重要,客户反馈涵盖English、Sinhala、Singlish及代码混合文本。现有模型在低资源语言如Sinhala方面难题且缺乏可解释性。本研究开发混合方面情感分析框架,提升多语言能力并提供可解释输出。使用清洗后的银行客户评论,我们对XLM-RoBERTa进行微调以适配Sinhala和代码混合文本,对英文采用BERT-base-uncased。系统以置信度评分分类情感(positive, neutral, negative),通过SHAP和LIME提供实时情感解释。实验结果显示,我们的方法优于传统基于transformer的分类器,在English中达到92.3%准确率和0.89的F1分数,在Sinhala和代码混合内容中达到88.4%。可解释性分析揭示情感驱动因素,提升信任与透明度。用户友好的界面提供方面情感洞察,确保业务可访问性。本研究通过填补多语言、低资源NLP及可解释性领域的空白,为金融应用构建稳健、透明的情感分析系统。
关键词
引用
@article{arxiv.2504.13545,
title = {Enhancing Multilingual Sentiment Analysis with Explainability for Sinhala, English, and Code-Mixed Content},
author = {Azmarah Rizvi and Navojith Thamindu and A. M. N. H. Adhikari and W. P. U. Senevirathna and Dharshana Kasthurirathna and Lakmini Abeywardhana},
journal= {arXiv preprint arXiv:2504.13545},
year = {2025}
}
备注
6 pages, 6 figures, 4 tables