中文

基于大语言模型和可解释AI的低资源语言多语种情感词典

计算与语言 2024-11-08 v1 人工智能 机器学习

摘要

南非和刚果民主共和国(DRC)呈现出复杂的语言格局,拥有祖鲁语、Sepedi语、阿非利卡语、法语、英语和Tshiluba语(Ciluba)等语言,这给AI驱动的翻译和情感分析系统带来了独特的挑战,原因是缺乏准确标注的数据。本研究旨在通过开发面向法语和Tshiluba语的多语种词典来解决这些挑战,现已扩展为包含英语、阿非利卡语、Sepedi语和祖鲁语的翻译。该词典通过整合语言特定的情感分数来增强情感分类的文化相关性。创建了一个全面的测试语料库以支持翻译和情感分析任务,使用随机森林(Random Forest)、支持向量机(SVM)、决策树(Decision Trees)和高斯朴素贝叶斯(GNB)等机器学习模型来预测低资源语言(LRLs)的情感。其中,随机森林模型表现尤为出色,有效捕捉了情感极性并处理了语言特定的细微差别。此外,双向编码器表示来自Transformer(BERT),一种大语言模型(LLM),被应用于以高准确率预测基于上下文的情感,准确率达到99%,精确率达到98%,优于其他模型。BERT预测通过可解释AI(XAI)加以澄清,提高了透明度并增强了对情感分类的信心。总体而言,研究结果表明所提出的词典和机器学习模型显著提升了南非和DRC的低资源语言的翻译和情感分析能力,为未来支持代表性不足语言的AI模型奠定了基础,其应用涵盖教育、治理和多语商业环境。

关键词

引用

@article{arxiv.2411.04316,
  title  = {A Multilingual Sentiment Lexicon for Low-Resource Language Translation using Large Languages Models and Explainable AI},
  author = {Melusi Malinga and Isaac Lupanda and Mike Wa Nkongolo and Phil van Deventer},
  journal= {arXiv preprint arXiv:2411.04316},
  year   = {2024}
}

备注

This work is part of a PhD proposal in Information Technology at the University of Pretoria, supervised by Dr. Mike Wa Nkongolo and co-supervised by Dr. Phil van Deventer, under the Low-Resource Language Processing Lab in the Department of Informatics