中文

数据收集的因果方向至关重要:因果与反因果学习对 NLP 的启示

计算与语言 2021-10-20 v2 人工智能 机器学习

摘要

独立因果机制(ICM)原理指出,真实世界数据的生成过程由相互独立的模块组成,这些模块彼此不影响也不提供信息。尽管这一思想在因果推断领域已带来丰硕进展,但在 NLP 社区中并不广为人知。在这项工作中,我们论证数据收集过程的因果方向具有不可忽视的启示,能够解释若干已发表的 NLP 发现,例如不同设定下半监督学习(SSL)与领域自适应(DA)性能的差异。我们依据因果方向对常见 NLP 任务进行分类,并使用最小描述长度对文本数据中 ICM 原理的有效性进行实证检验。我们对超过 100 篇已发表的 SSL 研究和 30 篇 DA 研究进行了广泛的元分析,发现结果与基于因果洞察的预期一致。本工作首次尝试在 NLP 中分析 ICM 原理,并为未来的建模选择提供建设性建议。代码见 https://github.com/zhijing-jin/icm4nlp

关键词

引用

@article{arxiv.2110.03618,
  title  = {Causal Direction of Data Collection Matters: Implications of Causal and Anticausal Learning for NLP},
  author = {Zhijing Jin and Julius von Kügelgen and Jingwei Ni and Tejas Vaidhya and Ayush Kaushal and Mrinmaya Sachan and Bernhard Schölkopf},
  journal= {arXiv preprint arXiv:2110.03618},
  year   = {2021}
}

备注

EMNLP 2021 (Oral)