中文

高效数据驱动的概念形成以支持掩码词预测

计算与语言 2024-09-20 v1 人工智能

摘要

本文提出了 Cobweb4L,这是一种高效语言模型学习方法,支持掩码词预测。该方法基于 Cobweb,即一种渐进式系统,用于学习概率概念的层次结构。每个概念存储了与该概念标签标记的实例中出现的单词频率。该系统利用属性值表示来编码单词及其周围上下文以生成实例。Cobweb4L 使用信息论变体的类别效用以及一种新型性能机制,利用多个概念生成预测。我们证明,凭借这些扩展,该方法显著优于仅使用单个节点生成预测的早期 Cobweb 性能机制。进一步地,我们展示了 Cobweb4L 能够快速学习,并在性能上与甚至优于 Word2Vec。随后,我们表明 Cobweb4L 和 Word2Vec 在相同任务中均优于 BERT,且所需训练数据更少。最后,我们讨论了使结论更加稳健和包容的未来工作。

关键词

引用

@article{arxiv.2409.12440,
  title  = {Incremental and Data-Efficient Concept Formation to Support Masked Word Prediction},
  author = {Xin Lian and Nishant Baglodi and Christopher J. MacLellan},
  journal= {arXiv preprint arXiv:2409.12440},
  year   = {2024}
}

备注

Accepted by the Eleventh Annual Conference on Advances in Cognitive Systems