中文

用于多领域文本分类的正则化条件对齐

计算与语言 2023-12-20 v1 密码学与安全 机器学习

摘要

最成功的多领域文本分类(MDTC)方法采用共享-私有范式,通过领域特定属性来促进领域不变特征的增强。此外,它们采用对抗训练来对齐边缘特征分布。然而,这些方法面临两个主要挑战:(1)在对抗对齐过程中忽略类别感知信息会导致错配风险;(2)跨多个领域的标注数据有限,无法确保模型具备足够的判别能力。为了解决这些问题,我们提出了一种名为正则化条件对齐(RCA)的方法,以对齐领域和类别的联合分布,从而匹配同一类别内的特征并增强所获特征的判别特性。此外,我们采用熵最小化和虚拟对抗训练来约束与无标签数据相关预测的不确定性,并增强模型的鲁棒性。在两个基准数据集上的实验结果表明,我们的 RCA 方法优于最先进的 MDTC 技术。

关键词

引用

@article{arxiv.2312.11572,
  title  = {Regularized Conditional Alignment for Multi-Domain Text Classification},
  author = {Juntao Hu and Yuan Wu},
  journal= {arXiv preprint arXiv:2312.11572},
  year   = {2023}
}

备注

This paper has been accepted by ICASSP 2024