置信度-可信度加权小型 LLM 集成在情感检测中超越大型 LLM
计算与语言
2025-12-22 v1 机器学习
摘要
本文提出一种基于置信度加权、可信度感知的小型大语言模型(sLLM)集成框架,用于文本情感检测,灵感来源于孔洛斯特投票定理(CJT)。不同于常规集成依赖单一架构的方式,本方法将组合多种基于变换器架构的小型大语言模型(sLLM)——BERT、RoBERTa、DistilBERT、DeBERTa 和 ELECTRA,每个模型均针对情感分类进行完全微调。为保持错误多样性,我们最小化参数收敛,同时利用每个模型的独特偏差。一种双重加权投票机制整合了全局可信度(验证 F1 分数)和局部置信度(实例级概率),以动态加权各模型的贡献。在DAIR-AI 数据集上的实验表明,置信度-可信度集成实现了 93.5% 的宏 F1 分数,超越了最新的基准测试,显著优于包括 Falcon、Mistral、Qwen 和 Phi 在内的大规模 LLM,即使在进行特定任务的低秩适应(LoRA)后亦然。总计仅 5.95 百万参数的小型 LLM 集成在参数效率和鲁棒性上均优于最高可达 700 万参数的模型,表明在此类自然语言处理任务(如情感检测)中,经过精心设计的小型微调模型集成可以超越规模更大的 LLM。
引用
@article{arxiv.2512.17630,
title = {Confidence-Credibility Aware Weighted Ensembles of Small LLMs Outperform Large LLMs in Emotion Detection},
author = {Menna Elgabry and Ali Hamdi},
journal= {arXiv preprint arXiv:2512.17630},
year = {2025}
}
备注
Accepted at IRICT 2025