AEMLO:基于自编码器引导的多标签过采样
机器学习
2024-08-26 v1 人工智能
摘要
类别不平衡显著影响多标签分类器的性能。过采样是最流行的方法之一,因为它增强了与较少出现的标签相关的实例以平衡类别分布。现有过采样方法通过复制或线性插值生成合成样本的特征向量,并通过邻域信息分配标签。线性插值通常会在现有数据点之间生成新样本,这可能导致合成样本的多样性不足,从而进一步引发过拟合问题。基于深度学习的方法,如自编码器,被提出用于生成更具多样性和复杂性的合成样本,在不平衡的二分类或多分类数据集上取得了优异性能。本研究引入 AEMLO,这是一种针对处理不平衡多标签数据设计的自编码器引导过采样技术。AEMLO 基于两个基本组件构建。第一个是编码器-解码器架构,使模型能够将输入数据编码到低维特征空间,学习其潜在表示,然后重建回原始维度,从而应用于新数据的生成。第二个是针对多标签场景优化采样任务的目标函数。我们展示了 AEMLO 在大量实证研究中优于现有最先进的方法。
引用
@article{arxiv.2408.13078,
title = {AEMLO: AutoEncoder-Guided Multi-Label Oversampling},
author = {Ao Zhou and Bin Liu and Jin Wang and Kaiwei Sun and Kelin Liu},
journal= {arXiv preprint arXiv:2408.13078},
year = {2024}
}