中文

研究数据量与域相似度对迁移学习应用的影响

计算机视觉与模式识别 2018-06-01 v4 人工智能

摘要

迁移学习允许实践者识别并应用先前任务(源任务)中学到的知识到共享某些共性的新任务或新域(目标任务)。影响迁移学习模型性能的两个重要因素是:(a) 目标数据集的大小,以及 (b) 源域与目标域之间分布的相似度。迄今为止,关于这些因素究竟有多重要鲜有研究。在本文中,我们通过一系列实验研究目标数据集大小以及源/目标域相似度对模型性能的影响。我们发现更多的数据总是有益的,并且模型性能随数据大小的对数线性提升,直到数据用尽。随着源/目标域差异增大,需要更多数据,且微调将比特征提取获得更好性能。当源/目标域相似且数据量较小时,微调与特征提取性能相当。我们希望通过开启关于迁移学习中数据量与域相似度影响的定量研究,能启发他人探索数据在开发更精确统计模型中的重要性。

关键词

引用

@article{arxiv.1712.04008,
  title  = {Investigating the Impact of Data Volume and Domain Similarity on Transfer Learning Applications},
  author = {Michael Bernico and Yuntao Li and Dingchao Zhang},
  journal= {arXiv preprint arXiv:1712.04008},
  year   = {2018}
}

备注

9 pages