来自临床研究对NLP模型泛化的启示
计算与语言
2024-04-03 v3
摘要
NLP社区通常依赖模型在留出测试集上的性能来评估泛化。在官方测试集之外的数据集中观察到的性能下降通常被归因于'分布外'效应。在此,我们探究泛化性的基础并研究影响其的因素,阐发来自临床研究的经验。在临床研究中,泛化是一种推理行为,取决于(a)实验的内部效度以确保对因果的受控度量,以及(b)结果对更广泛人群的外部效度或可迁移性。我们展示了学习虚假关联(例如关系抽取任务中实体间的距离)如何影响模型的内部效度,进而对泛化产生不利影响。因此,我们提出在构建NLP中的机器学习模型时需确保内部效度。我们的建议也适用于生成式大型语言模型,因为已知它们即使对细微的语义保持改写也很敏感。我们还提出将随机对照试验与观察性研究中的匹配思想适配到NLP评估中以度量因果关系。
引用
@article{arxiv.2311.03663,
title = {Principles from Clinical Research for NLP Model Generalization},
author = {Aparna Elangovan and Jiayuan He and Yuan Li and Karin Verspoor},
journal= {arXiv preprint arXiv:2311.03663},
year = {2024}
}
备注
Accepted to NAACL 2024