Expedition:一种用于概念层次无监督学习的系统
机器学习
2021-12-20 v1 计算与语言
摘要
我们提出一个系统,用于自底向上累积学习对应于有意义字符串的无数概念,及其部分相关与预测边。该学习是自监督的,在于所发现的概念既用作预测器也用作预测目标。我们设计了一个利用所学概念进行分割的目标,其源自与基线预测系统的比较,可促进生成并使用更大的概念,这转而允许预测更长的文本跨度,并且我们描述了一种促进探索的简单技术,即在分割过程中尝试新生成的概念。我们论证并解释了一种概念的分层,以帮助分离概念间学习的(条件)分布。概念的分层大致对应于部分-整体概念层次。借助初级的分割与学习算法,该系统是有前景的:它获取了许多概念(在我们的小规模实验中达数万),并学会良好地分割文本:当输入去除空格的英文文本、从字符级开始时,所学内容大多尊重词或短语边界,且随着更大的概念被发现以及系统学会在分割时使用它们,分割中“坏”切分(即词内切分)的平均数量随时间下降。我们报告了当输入文本转为二进制且系统仅以两个概念“0”和“1”开始时有前景的实验。该系统是透明的,在于容易分辨所学概念对应什么、哪些在分割中激活,或系统如何“看”其输入。我们期望该框架可扩展,并讨论了当前的局限性与若干增强学习与推断能力的方向。
引用
@article{arxiv.2112.09348,
title = {Expedition: A System for the Unsupervised Learning of a Hierarchy of Concepts},
author = {Omid Madani},
journal= {arXiv preprint arXiv:2112.09348},
year = {2021}
}