CAMO:一种面向不平衡数据的类感知少数派优化集成方法,用于鲁棒语言模型评估
计算与语言
2026-04-14 v2 机器学习
摘要
由于传统集成方法偏向多数类,导致少数类性能下降和整体F1分数降低,实际的分类任务在面临严重的类别不平衡问题。我们提出了一种独特的用于处理不平衡问题的集成技术,称为CAMO(Class-Aware Minority-Optimized,类感知少数派优化)。通过包含投票分布、置信度校准和模型间不确定性的分层程序,CAMO能够动态提升被低估的类别,同时保持并放大少数类的预测。我们在两个高度不平衡的特定领域基准数据集上验证了CAMO:DIAR-AI/Emotion数据集和三分类的BEA 2025数据集。我们使用八种不同的语言模型(其中三种是大语言模型,五种是小语言模型)在零样本和微调设置下,对比七种已验证的集成算法。通过优化后的模型,CAMO在所有情况下都获得了最高的严格宏观F1分数,达到了新的基准。其优势与模型适应性相互配合,表明最佳集成选择取决于模型属性。这表明CAMO是一个可靠的、通用的不平衡分类框架。
引用
@article{arxiv.2604.07583,
title = {CAMO: A Class-Aware Minority-Optimized Ensemble for Robust Language Model Evaluation on Imbalanced Data},
author = {Mohamed Ehab and Ali Hamdi and Khaled Shaban},
journal= {arXiv preprint arXiv:2604.07583},
year = {2026}
}