语言模型如何获取字符级信息?
计算与语言
2026-02-06 v1
摘要
语言模型(LMs)被报告在未显式提供字符级信息的情况下隐式编码字符级信息。然而,这一现象背后的机制仍然基本未被探索。为揭示这些机制,我们通过比较在受控设置下训练的模型(如指定预训练数据集或分词器),与在标准设置下训练的模型来分析模型如何获取字符级知识。我们将贡献因素分为与分词无关的因素。我们的分析表明,合并规则和正字法约束是分词中产生的主要因素,而子串的语义关联和句法信息则是独立于分词的关键因素。
引用
@article{arxiv.2602.05347,
title = {How Do Language Models Acquire Character-Level Information?},
author = {Soma Sato and Ryohei Sasano},
journal= {arXiv preprint arXiv:2602.05347},
year = {2026}
}
备注
Accepted to EACL 2026 Main Conference