中文

解释反事实增强数据的有效性

计算与语言 2021-03-25 v4 人工智能 机器学习 机器学习

摘要

为产出较少依赖 NLP 数据集中虚假模式的 ML 模型,研究者近期提出通过人在回路流程策划反事实增强数据(CAD):给定若干文档及其(初始)标签,人类必须修改文本以使反事实标签适用。重要的是,禁止那些对翻转适用标签非必要的编辑。经验上,在增强数据上训练的模型似乎较少依赖语义无关词,并在域外泛化更好。尽管该工作松散地借用了因果思维,其底层因果模型(即便在抽象层面)以及观察到的域外改进背后的原理仍不清楚。本文中,我们引入基于线性高斯模型的玩具类比,观察到因果模型、测量噪声、域外泛化以及对虚假信号依赖之间的有趣关系。我们的分析提供了一些有助于解释 CAD 有效性的见解。此外,我们提出假设:虽然向因果特征加噪声会同时降低域内与域外表现,向非因果特征加噪声应带来域外表现的相对提升。该想法启发了一种推测性检验,用于判定特征归因技术是否识别出了因果片段。如果向高亮片段加噪声(例如随机翻转词)在一组挑战数据集上同时降低域内与域外表现,而向其补集加噪声带来域外提升,则表明我们已识别出因果片段。我们呈现了一项大规模实证研究,比较为创建 CAD 而编辑的片段与注意力和显著图所选片段。在众多领域与模型中,我们发现该假设现象对 CAD 尤为明显。

关键词

引用

@article{arxiv.2010.02114,
  title  = {Explaining The Efficacy of Counterfactually Augmented Data},
  author = {Divyansh Kaushik and Amrith Setlur and Eduard Hovy and Zachary C. Lipton},
  journal= {arXiv preprint arXiv:2010.02114},
  year   = {2021}
}

备注

Published at ICLR 2021