中文

面向日语情感分类的 RoBERTa 与 DeBERTa 模型性能评估

计算与语言 2025-05-02 v1 人工智能

摘要

背景:社交媒体监控和客户反馈分析等实际应用需要准确检测日语句子中的情感,而资源稀缺和类别不平衡阻碍了模型性能。目标:本研究旨在构建高精度模型,用于预测日语句子中八种普鲁切克情感(Plutchik emotions)是否存在。方法:基于 WRIME 语料库,将读者平均情感强度分数转化为二元标签,对四个预训练语言模型(BERT、RoBERTa、DeBERTa-v3-base、DeBERTa-v3-large)进行微调。就情境而言,我们还评估了两个大型语言模型(TinySwallow-1.5B-Instruct 和 ChatGPT-4o)。以准确率和 F1 分数作为评估指标。结果:DeBERTa-v3-large 实现了最佳的平均准确率(0.860)和 F1 分数(0.662),超越所有其他模型。该模型在高频情感(如喜悦、期待)和低频情感(如愤怒、信任)方面均保持稳健的 F1 分数。大型语言模型表现滞后,ChatGPT-4o 和 TinySwallow-1.5B-Instruct 的平均 F1 分数分别为 0.527 和 0.292。结论:目前微调的 DeBERTa-v3-large 模型是日语二元情感分类的最可靠解决方案。我们将该模型发布为可通过 pip 安装的软件包(pip install deberta-emotion-predictor)。未来工作应增加稀有情感的数据,减小模型规模,并探索提示工程以提高大型语言模型性能。本稿件正在审稿中,争取发表于《新一代计算》(New Generation Computing)杂志。

关键词

引用

@article{arxiv.2505.00013,
  title  = {Performance Evaluation of Emotion Classification in Japanese Using RoBERTa and DeBERTa},
  author = {Yoichi Takenaka},
  journal= {arXiv preprint arXiv:2505.00013},
  year   = {2025}
}

备注

14 pages, 3 tables, 3 appendices. Submitted to New Generation Computing. Includes comparisons between fine-tuned PLMs and LLMs on Japanese emotion classification. Code available at https://pypi.org/project/deberta-emotion-predictor/