中文

CAARMA:基于对抗混合正则化的类别增强

声音 2026-02-03 v4 计算与语言 机器学习

摘要

说话人验证是一种典型的零样本学习任务,其中对未见类别的推理通过将测试实例的嵌入与已知示例进行比较来完成。因此,执行推理的模型必须自然地生成能够将同类实例紧凑聚类的嵌入,同时保持类别之间的分离。为实现这一点,它们通常需要在大量类别(说话人)上进行训练,通常使用专门的损失函数。然而,真实的说话人数据集通常缺乏有效泛化学习所需的类别多样性。我们提出了CAARMA,一个类别增强框架,通过在嵌入空间中进行数据混合来生成合成类别,从而扩展训练类别的数量,以解决这一问题。为确保合成类别的真实性,我们采用了一种新颖的对抗精化机制,以最小化合成类别与真实类别之间的类别差异。我们在多个说话人验证任务以及其他具有代表性的基于比较的零样本语音分析任务上评估了CAARMA,并获得了持续改进:我们的框架相较于所有基线模型实现了8%的显著提升。代码可在以下地址获取:https://github.com/massabaali7/CAARMA/

关键词

引用

@article{arxiv.2503.16718,
  title  = {CAARMA: Class Augmentation with Adversarial Mixup Regularization},
  author = {Massa Baali and Xiang Li and Hao Chen and Syed Abdul Hannan and Rita Singh and Bhiksha Raj},
  journal= {arXiv preprint arXiv:2503.16718},
  year   = {2026}
}

备注

Accepted to EMNLP 2025 Findings