中文

面向改进(大)语言模型泛化的数据增强

机器学习 2024-01-10 v2 计算与语言

摘要

文本分类器对虚假相关性的依赖可能导致部署时泛化能力差,引发其在医疗等安全关键领域使用的担忧。本工作中,我们提出使用反事实数据增强,在已知数据因果结构的引导下,模拟对虚假特征的干预并学习更鲁棒的文本分类器。我们表明该策略适用于标签与某属性存在虚假相关性的预测问题。在此类问题的假设下,我们讨论了相较于重要性重加权的反事实数据增强的良好样本复杂度。从实用角度,我们基于双重差分(diff-in-diff)方法利用辅助数据匹配样本,并使用大语言模型(LLM)表示文本的条件概率。通过在从医疗叙述中学习临床诊断的照护者不变预测器以及半合成数据上的大量实验,我们证明我们的干预模拟方法相比基线不变学习算法提升了分布外(OOD)准确率。

关键词

引用

@article{arxiv.2310.12803,
  title  = {Data Augmentations for Improved (Large) Language Model Generalization},
  author = {Amir Feder and Yoav Wald and Claudia Shi and Suchi Saria and David Blei},
  journal= {arXiv preprint arXiv:2310.12803},
  year   = {2024}
}

备注

Published at NeurIPS 2023