中文

来自临床研究对NLP模型泛化的启示

计算与语言 2024-04-03 v3

摘要

NLP社区通常依赖模型在留出测试集上的性能来评估泛化。在官方测试集之外的数据集中观察到的性能下降通常被归因于'分布外'效应。在此,我们探究泛化性的基础并研究影响其的因素,阐发来自临床研究的经验。在临床研究中,泛化是一种推理行为,取决于(a)实验的内部效度以确保对因果的受控度量,以及(b)结果对更广泛人群的外部效度或可迁移性。我们展示了学习虚假关联(例如关系抽取任务中实体间的距离)如何影响模型的内部效度,进而对泛化产生不利影响。因此,我们提出在构建NLP中的机器学习模型时需确保内部效度。我们的建议也适用于生成式大型语言模型,因为已知它们即使对细微的语义保持改写也很敏感。我们还提出将随机对照试验与观察性研究中的匹配思想适配到NLP评估中以度量因果关系。

关键词

引用

@article{arxiv.2311.03663,
  title  = {Principles from Clinical Research for NLP Model Generalization},
  author = {Aparna Elangovan and Jiayuan He and Yuan Li and Karin Verspoor},
  journal= {arXiv preprint arXiv:2311.03663},
  year   = {2024}
}

备注

Accepted to NAACL 2024