面向多领域文本分类的协同正则化对抗学习
机器学习
2022-02-01 v1 计算与语言
摘要
多领域文本分类(MDTC)旨在利用来自多个领域的所有可用资源来学习一个在这些领域上泛化良好的预测模型。近来,许多 MDTC 方法采用对抗学习、共享-私有范式以及熵最小化取得了最先进(SOTA)的结果。然而,这些方法面临三个问题:(1)最小化领域散度无法完全保证领域对齐的成功;(2)对齐边缘特征分布无法完全保证所学特征的可判别性;(3)标准熵最小化可能使对未标注数据的预测过度自信,从而损害所学特征的可判别性。为解决上述问题,我们提出一种用于 MDTC 的协同正则化对抗学习(CRAL)机制。该方法构建两个多样的共享潜在空间,在各自空间中进行领域对齐,并惩罚这两种对齐关于未标注数据预测的分歧。此外,结合带熵最小化的虚拟对抗训练(VAT)对 CRAL 方法施加一致性正则化。实验表明,我们的模型在两个 MDTC 基准上优于最先进方法。
引用
@article{arxiv.2201.12796,
title = {Co-Regularized Adversarial Learning for Multi-Domain Text Classification},
author = {Yuan Wu and Diana Inkpen and Ahmed El-Roby},
journal= {arXiv preprint arXiv:2201.12796},
year = {2022}
}
备注
The paper will appear in AISTATS 2022