中文

语言模型如何获取字符级信息?

计算与语言 2026-02-06 v1

摘要

语言模型(LMs)被报告在未显式提供字符级信息的情况下隐式编码字符级信息。然而,这一现象背后的机制仍然基本未被探索。为揭示这些机制,我们通过比较在受控设置下训练的模型(如指定预训练数据集或分词器),与在标准设置下训练的模型来分析模型如何获取字符级知识。我们将贡献因素分为与分词无关的因素。我们的分析表明,合并规则和正字法约束是分词中产生的主要因素,而子串的语义关联和句法信息则是独立于分词的关键因素。

关键词

引用

@article{arxiv.2602.05347,
  title  = {How Do Language Models Acquire Character-Level Information?},
  author = {Soma Sato and Ryohei Sasano},
  journal= {arXiv preprint arXiv:2602.05347},
  year   = {2026}
}

备注

Accepted to EACL 2026 Main Conference