用于多领域文本分类的随机对抗网络
计算与语言
2024-06-04 v1 机器学习
摘要
对抗训练在推动多领域文本分类(MDTC)方面发挥了重要作用。传统上,MDTC方法采用共享-私有范式,使用共享特征提取器获取领域不变知识,并使用独立的私有特征提取器获取领域特定知识。尽管取得了最先进的结果,但这些方法因不断添加新领域而面临模型参数激增的问题。为了解决这一挑战,我们引入了随机对抗网络(SAN),它创新地将领域特定特征提取器的参数建模为多元高斯分布,而不是传统的权重向量。这种设计允许生成大量领域特定的特征提取器,而无需显著增加模型参数,使模型大小与单个领域特定提取器相当。此外,我们的方法集成了领域标签平滑和鲁棒伪标签正则化,分别用于增强对抗训练的稳定性和改善特征判别性。我们的SAN在两个领先的MDTC基准测试上的性能证明了其相对于当前最先进方法的竞争优势。代码可在 https://github.com/wangxu0820/SAN 获取。
引用
@article{arxiv.2406.00044,
title = {Stochastic Adversarial Networks for Multi-Domain Text Classification},
author = {Xu Wang and Yuan Wu},
journal= {arXiv preprint arXiv:2406.00044},
year = {2024}
}
备注
Technical report