面向低资源南非语言的 TriLex 多语言情感分析框架
计算与语言
2025-12-03 v1
摘要
低资源非洲语言在情感分析领域仍不足,限制了词汇覆盖范围和多语言自然语言处理系统的性能。本研究提出 TriLex,一个三阶段检索增强框架,统一语料库基础提取、跨语言映射和检索增强生成 (RAG) 驱动的词汇细化,以系统性地扩展低资源语言的情感词典。使用丰富后的词典,评估了两个主要流行的非洲预训练语言模型 (AfroXLMR 和 AfriBERTa) 的性能。结果表明,AfroXLMR 能实现 isiXhosa 和 isiZulu 超过 80% 的 F1 分数,并展现出强大的跨语言稳定性。尽管 AfriBERTa未在这些目标语言上进行预训练,但仍能实现约 64% 的可靠 F1 分数,验证了其在计算受限环境中的实用性。两种模型均优于传统机器学习基线,集成分析进一步提高了精度和鲁棒性。本研究表明 TriLex 是面向低资源南非语言的多语言情感词典扩展和情感建模的可扩展且有效的框架。
引用
@article{arxiv.2512.02799,
title = {TriLex: A Framework for Multilingual Sentiment Analysis in Low-Resource South African Languages},
author = {Mike Nkongolo and Hilton Vorster and Josh Warren and Trevor Naick and Deandre Vanmali and Masana Mashapha and Luke Brand and Alyssa Fernandes and Janco Calitz and Sibusiso Makhoba},
journal= {arXiv preprint arXiv:2512.02799},
year = {2025}
}