Sinhala 语、英语及语码混合内容中的关键词提取与方面分类
计算与语言
2025-04-16 v1 人工智能
机器学习
摘要
银行业品牌声誉的维护依赖于对语码混合和多语言内容中客户观点的深入分析。传统 NLP 模型在与 Sinhala 语-英语等低资源语言混合时会误分类或忽略语码混合文本,且无法捕捉领域特定知识。本研究引入了一种混合 NLP 方法,以改进银行业内容的关键词提取、内容过滤和基于方面的分类。英语关键词提取采用混合方法,包含微调的 SpaCy NER 模型、基于 FinBERT 的 KeyBERT 嵌入、YAKE 和 EmbedRank,其综合准确率达到 91.2%。语码混合和 Sinhala 语关键词的提取使用结合了领域特定 Sinhala 语金融词汇的微调 XLM-RoBERTa 模型,准确率达到 87.4%。为确保数据质量,使用多个模型进行了无关评论过滤,其中 BERT-base-uncased 模型在英语上达到 85.2%,XLM-RoBERTa 在 Sinhala 语上达到 88.1%,优于 GPT-4o、SVM 和基于关键词的过滤方法。方面分类遵循相同的模式,BERT-base-uncased 模型在英语上达到 87.4%,XLM-RoBERTa 在 Sinhala 语上达到 85.9%,两者均超越了 GPT-4 和基于关键词的方法。这些发现证实,在多语言金融文本分析中,微调的 Transformer 模型优于传统方法。本框架为语码混合和低资源银行业环境下的品牌声誉监控提供了一种准确且可扩展的解决方案。
引用
@article{arxiv.2504.10679,
title = {Keyword Extraction, and Aspect Classification in Sinhala, English, and Code-Mixed Content},
author = {F. A. Rizvi and T. Navojith and A. M. N. H. Adhikari and W. P. U. Senevirathna and Dharshana Kasthurirathna and Lakmini Abeywardhana},
journal= {arXiv preprint arXiv:2504.10679},
year = {2025}
}
备注
6 Pages, 2 figures, 7 Tables