中文

噪声中的信号:用字符感知语言模型探索随机字符序列所编码的意义

计算与语言 2022-04-21 v2 机器学习

摘要

自然语言处理模型基于分布假说学习词表示,该假说认为词的上下文(如共现)与意义相关。我们提出,由随机字符序列构成的nn元文法(或称garblegarble)为研究现存语言内外词意义提供了新颖的上下文。具体而言,随机生成的字符nn元文法虽无意义,但包含基于其所含字符分布的原始信息。通过使用CharacterBERT研究大规模garble、现存语言与伪词语料库的嵌入,我们识别出模型高维嵌入空间中分离这些nn元文法类别的轴。此外,我们表明该轴与现存语言内部结构相关,包括词的词性、形态学与概念具体性。因此,与主要局限于现存语言的研究相反,我们的工作揭示了意义与原始信息本质相连。

关键词

引用

@article{arxiv.2203.07911,
  title  = {Signal in Noise: Exploring Meaning Encoded in Random Character Sequences with Character-Aware Language Models},
  author = {Mark Chu and Bhargav Srinivasa Desikan and Ethan O. Nadler and D. Ruggiero Lo Sardo and Elise Darragh-Ford and Douglas Guilbeault},
  journal= {arXiv preprint arXiv:2203.07911},
  year   = {2022}
}