中文

语义感知的生成式潜在数据增强框架:用于低资源领域的学习

机器学习 2026-02-10 v2 人工智能

摘要

尽管深度学习在数据丰富的场景中表现出色,但在实际中常见的数据稀缺环境下常表现不佳。虽然基于大规模数据训练的基础模型(FMs)通过提取通用特征展现出强大的泛化能力,但在下游微调过程中仍可能因标注数据稀缺而受限。为此,我们提出GeLDA(Semantics-Aware Generative Latent Data Augmentation),一种利用条件扩散模型在 FM 激发的潜在空间中合成样本的语义感知生成式潜在数据增强框架。由于该潜在空间低维且集中任务相关信息(相较于输入空间),GeLDA 能够实现高效、高质量的数据生成。GeLDA 通过对辅助特征向量进行条件化,以捕获类别或子域之间的语义关系,从而支持低资源领域的数据增强。我们在两个大规模识别任务中验证了 GeLDA:(a) 在零样本语言特定语音情感识别中,GeLDA 将 Whisper-large 基线模型的 unweighted average recall 提升了 6.13%;(b) 在长尾图像分类中,它在 ImageNet-LT 上实现了 74.7% 的尾类准确率,创下了新的最佳结果。

关键词

引用

@article{arxiv.2602.02841,
  title  = {Semantics-Aware Generative Latent Data Augmentation for Learning in Low-Resource Domains},
  author = {Jaesung Bae and Minje Kim},
  journal= {arXiv preprint arXiv:2602.02841},
  year   = {2026}
}