中文

利用迁移学习克服数据稀缺性

机器学习 2017-11-15 v1 材料科学 机器学习

摘要

尽管材料科学及相关领域日益关注数据发布与发现,但材料数据的全局视图仍高度稀疏。这种稀疏性促使人们在多个数据集的并集上训练模型,但简单的并集可能存在问题,因为(表面上)等价的属性可能因数据源不同而以不同方式测量或计算。这些隐藏的上下文差异给分析引入了不可约误差,从根本上限制了其准确性。迁移学习将一个数据集中的信息用于指导另一数据集上的模型,可成为在保留底层测量中上下文差异的同时桥接稀疏数据的有效工具。在此,我们描述并比较了三种迁移学习技术:多任务、差值与显式潜变量架构。我们表明,在混合 DFT 与实验带隙的多保真度情形下,差值架构最为准确;而多任务架构最能提升颜色与带隙分类的性能。对于 NO 还原步骤的活化能,显式潜变量方法不仅最准确,而且在依赖于多个任务的函数中享有误差相消。这些结果激励人们发布编码可迁移信息的高质量材料数据集(无论对特定标签的工业或学术兴趣如何),并鼓励进一步开发和应用迁移学习方法解决材料信息学问题。

关键词

引用

@article{arxiv.1711.05099,
  title  = {Overcoming data scarcity with transfer learning},
  author = {Maxwell L. Hutchinson and Erin Antono and Brenna M. Gibbons and Sean Paradiso and Julia Ling and Bryce Meredig},
  journal= {arXiv preprint arXiv:1711.05099},
  year   = {2017}
}