源域过拟合还是欠拟合?问答中领域泛化的实证研究
计算与语言
2022-10-26 v3 机器学习
摘要
机器学习模型易于过拟合其训练(源)领域,这通常被认为是它们在新颖目标领域表现不佳的原因。在此我们考察一种相反的观点:多源领域泛化(DG)首先且首要的是缓解源领域欠拟合的问题,即模型未能充分学习其多领域训练数据中已有的信号。在阅读理解 DG 基准上的实验表明,随着模型更好地学习其源领域——使用如来自更大模型的知识蒸馏(KD)等熟悉方法——其零样本域外效用以更快的速度提升。改进的源领域学习也展示出优于三种流行的、旨在限制过拟合的现有 DG 方法的域外泛化能力。我们基于 KD 的领域泛化实现可通过 PrimeQA 获取:https://ibm.biz/domain-generalization-with-kd。
引用
@article{arxiv.2205.07257,
title = {Not to Overfit or Underfit the Source Domains? An Empirical Study of Domain Generalization in Question Answering},
author = {Md Arafat Sultan and Avirup Sil and Radu Florian},
journal= {arXiv preprint arXiv:2205.07257},
year = {2022}
}
备注
Accepted at EMNLP 2022