韩文字体数据集:用于研究习得表示的分层与组合性数据集
计算机视觉与模式识别
2021-06-10 v2 机器学习
神经与进化计算
摘要
分层与组合性是许多自然和科学数据集中常见的潜在属性。确定深度网络的隐藏激活何时表示分层与组合性,对于理解深度表示学习以及在可解释性至关重要的领域应用深度网络都十分重要。然而,当前的基准机器学习数据集要么几乎没有分层或组合结构,要么结构未知。这一差距阻碍了对网络表示的精确分析,从而妨碍了能够学习此类属性的新方法的开发。为弥补这一差距,我们开发了一个具有已知分层与组合结构的新型基准数据集。韩文字体数据集(HFD)由朝鲜语书写系统(韩文)的35种字体组成,每种字体包含11,172个方块字(音节),由初声辅音、中声元音和终声辅音字形乘积构成。所有方块字可归为几种几何类型,从而在方块字间引入分层。此外,每个方块字由单个字形组成,具有旋转、平移、缩放以及跨字体的自然风格变化。我们发现,与有监督深度网络相比,浅层和无监督深度方法在其对HFD的表示中仅显示出微弱的分层与组合性证据。有监督深度网络表示包含与字符几何分层相关的结构,但数据的组合结构并不明显。因此,HFD能够识别现有方法的不足,这是开发新机器学习算法以在自然变异背景下提取分层与组合结构的关键第一步。
引用
@article{arxiv.1905.13308,
title = {Hangul Fonts Dataset: a Hierarchical and Compositional Dataset for Investigating Learned Representations},
author = {Jesse A. Livezey and Ahyeon Hwang and Jacob Yeung and Kristofer E. Bouchard},
journal= {arXiv preprint arXiv:1905.13308},
year = {2021}
}