中文

基于边际差异的对抗训练用于多域文本分类

计算与语言 2024-03-05 v1 机器学习

摘要

多域文本分类(MDTC)旨在利用来自相关域的可用资源来提高目标域的分类准确性。当前大多数MDTC方法采用对抗训练和共享-私有范式,已取得卓越的性能。然而,这些方法面临一个不容小觑的挑战:在MDTC算法设计中缺乏理论保证。这一缺乏理论依据为MDTC算法的发展构成了重大障碍。为解决这一问题,我们首先通过分解MDTC任务为多个域适应任务来进行理论分析。我们将边际差异作为域间差异的度量,并基于 Rademacher complexity 建立了新的泛化界限。随后,我们依据理论分析提出了基于边际差异的对抗训练(MDAT)方法用于MDTC。为验证所提MDAT方法的有效性,我们在两种MDTC基准数据集上进行经验研究。实验结果表明,我们的MDAT方法在两个数据集上均优于最先进的基线方法。

关键词

引用

@article{arxiv.2403.00888,
  title  = {Margin Discrepancy-based Adversarial Training for Multi-Domain Text Classification},
  author = {Yuan Wu},
  journal= {arXiv preprint arXiv:2403.00888},
  year   = {2024}
}

备注

16 pages