ReMask:一种用于领域反事实生成的鲁棒信息掩码方法
计算与语言
2023-05-05 v1 人工智能
摘要
领域偏移是NLP中的一大挑战,因此许多方法诉诸于学习领域不变特征以缓解推理阶段的领域偏移。然而,此类方法未能利用与当前任务相关的领域特定细微特征。为避免此类缺陷,领域反事实生成旨在将文本从源领域转换至给定目标领域。然而,由于数据可用性有限,此类基于频率的方法常遗漏并导致一些有效与虚假的领域-词元关联。为此,我们采用一种三步领域混淆方法,包含基于频率与注意力范数的掩码以掩盖领域特定线索,以及解掩码以恢复领域通用上下文。我们的实验经验表明,源自我们掩码文本的反事实样本在12个领域情感分类设定中的10个上带来了改进的领域迁移,在无监督领域自适应(UDA)上较最先进方法平均提升2%准确率。此外,我们的模型在对抗领域自适应(ADA)设定下以平均1.4%准确率提升优于最先进方法。并且,我们的模型在大型多领域意图分类数据集上也展现了其领域自适应效能,取得了最先进结果。我们在 \url{https://github.com/declare-lab/remask} 公开了代码。
引用
@article{arxiv.2305.02858,
title = {ReMask: A Robust Information-Masking Approach for Domain Counterfactual Generation},
author = {Pengfei Hong and Rishabh Bhardwaj and Navonil Majumdar and Somak Aditya and Soujanya Poria},
journal= {arXiv preprint arXiv:2305.02858},
year = {2023}
}
备注
12 pages, 1 figure, 8 tables, ACL 2023 Long Paper (Findings)