基于 DeepSeek-R1 的可解释情感分析:性能、效率与少样本学习
计算与语言
2026-02-05 v5 人工智能
摘要
大型语言模型(LLM)已变革了情感分析,但在平衡准确性、效率与可解释性方面仍面临关键挑战。本研究首次对开源推理模型 DeepSeek-R1 与 OpenAI 的 GPT-4o 及 GPT-4o-mini 进行了全面评估。我们测试了完整的 671B 模型及其蒸馏变体,并系统地记录了少样本学习曲线。实验表明,DeepSeek-R1 在 5 类情感任务中取得了 91.39% 的 F1 分数,在仅 5 个样本的二元任务中达到了 99.31% 的准确率,其少样本效率较 GPT-4o 提升了八倍。我们观察到了特定架构的蒸馏效应,其中基于 32B Qwen2.5 的模型比基于 70B Llama 的变体高出 6.69 个百分点。尽管其推理过程降低了吞吐量,DeepSeek-R1 通过透明、逐步的推理轨迹提供了卓越的可解释性,确立了其作为强大且可解释的开源替代方案的地位。
引用
@article{arxiv.2503.11655,
title = {Explainable Sentiment Analysis with DeepSeek-R1: Performance, Efficiency, and Few-Shot Learning},
author = {Donghao Huang and Zhaoxia Wang},
journal= {arXiv preprint arXiv:2503.11655},
year = {2026}
}
备注
10 pages, with 2 figures and 6 tables, accepted for publication in an IEEE Intelligent Systems journal