中文

探索用于异质性处理效应估计的Transformer骨干网络

机器学习 2022-10-18 v5

摘要

以往关于处理效应估计(TEE)的工作并未得到广泛应用,因为它们 predominantly 是理论性的,做出了强参数假设但在实际应用中难以处理。近期工作使用多层感知机(MLP)对因果关系建模,然而,MLP远远落后于机器学习方法的最新进展,这限制了其适用性和泛化能力。为超越单一领域形式并迈向更真实的学习场景,我们探索了MLP之外的模型设计空间,即transformer骨干网络,其提供的灵活性使得注意力层能够调控处理与协变量之间的交互,从而利用潜在结果的 structural similarities 进行混杂控制。通过精心的模型设计,提出了Transformers as Treatment Effect Estimators (TransTEE)。我们通过实验表明TransTEE能够:(1) 作为通用处理效应估计器,在多种具有挑战性的TEE问题(例如离散、连续、结构化或与剂量相关的处理)中显著优于竞争基线,并且适用于协变量为表格数据以及协变量由结构数据(例如文本、图)组成的情况;(2) 产生多重优势:与倾向得分建模兼容、参数高效、对连续处理值分布偏移具有鲁棒性、在协变量调整中可解释,以及在审计预训练语言模型中具有现实效用。

关键词

引用

@article{arxiv.2202.01336,
  title  = {Exploring Transformer Backbones for Heterogeneous Treatment Effect Estimation},
  author = {Yi-Fan Zhang and Hanlin Zhang and Zachary C. Lipton and Li Erran Li and Eric P. Xing},
  journal= {arXiv preprint arXiv:2202.01336},
  year   = {2022}
}