中文

基于 DeepSeek-R1 的可解释情感分析:性能、效率与少样本学习

计算与语言 2026-02-05 v5 人工智能

摘要

大型语言模型(LLM)已变革了情感分析,但在平衡准确性、效率与可解释性方面仍面临关键挑战。本研究首次对开源推理模型 DeepSeek-R1 与 OpenAI 的 GPT-4o 及 GPT-4o-mini 进行了全面评估。我们测试了完整的 671B 模型及其蒸馏变体,并系统地记录了少样本学习曲线。实验表明,DeepSeek-R1 在 5 类情感任务中取得了 91.39% 的 F1 分数,在仅 5 个样本的二元任务中达到了 99.31% 的准确率,其少样本效率较 GPT-4o 提升了八倍。我们观察到了特定架构的蒸馏效应,其中基于 32B Qwen2.5 的模型比基于 70B Llama 的变体高出 6.69 个百分点。尽管其推理过程降低了吞吐量,DeepSeek-R1 通过透明、逐步的推理轨迹提供了卓越的可解释性,确立了其作为强大且可解释的开源替代方案的地位。

关键词

引用

@article{arxiv.2503.11655,
  title  = {Explainable Sentiment Analysis with DeepSeek-R1: Performance, Efficiency, and Few-Shot Learning},
  author = {Donghao Huang and Zhaoxia Wang},
  journal= {arXiv preprint arXiv:2503.11655},
  year   = {2026}
}

备注

10 pages, with 2 figures and 6 tables, accepted for publication in an IEEE Intelligent Systems journal