关于 NLP 中性能效应的因果推断
计算与语言
2022-09-15 v1
摘要
本文强调,作为科学的 NLP 旨在推断在自然语言处理中应用某一方法(相较于另一方法)所产生的性能效应。然而实践中的 NLP 研究通常未能实现这一目标:NLP 研究文章通常仅比较少数几个模型。每个模型源自特定的流程管道(此处称为处理系统),该管道由预处理、预训练、超参数调优以及目标任务训练中所用的特定方法集合构成。要就应用某方法 A 与另一方法 B 所引起的性能效应做出可泛化的推断,仅比较由少数特定(可能不可比)处理系统生成的少数特定模型是不够的。相反,如下步骤将允许对方法的性能效应进行推断:(1) 须定义研究者欲推断至的处理系统总体。(2) 从该总体中抽取处理系统的随机样本。(样本中所抽处理系统在其流程管道所应用的方法上各异,且其用于训练与评估的训练和测试数据集构成亦不同。)(3) 每个处理系统分别应用一次方法 A 和一次方法 B。(4) 基于所应用处理系统的样本,近似方法 A 与方法 B 的期望泛化误差。(5) 方法 A 与方法 B 的期望泛化误差之差,即为在 processing systems 总体中应用方法 A 相较于方法 B 的估计平均处理效应。
引用
@article{arxiv.2209.06790,
title = {Drawing Causal Inferences About Performance Effects in NLP},
author = {Sandra Wankmüller},
journal= {arXiv preprint arXiv:2209.06790},
year = {2022}
}
备注
15 pages