中文

通过 Token 内部结构学习提升大语言模型的字符级理解能力

计算与语言 2025-06-10 v5

摘要

字节对编码(Byte-Pair Encoding,BPE)等分词方法虽提升了大语言模型(LLM)的计算效率,但常使 token 内部的字符结构变得不清晰。此限制阻碍了 LLM 对精确字符位置的预测能力,而在中文拼写纠错(Chinese Spelling Correction,CSC)等任务中,识别错误字符的位置对于加快纠错流程至关重要。我们提出 Token 内部位置感知(Token Internal Position Awareness,TIPA)方法,通过在 tokenizer 词汇表中进行逆向字符预测任务训练,显著提升模型捕捉 token 内部字符位置的能力。实验表明,TIPA 增强了 LLM 在位置预测中的准确性,使其能更精确地识别原文中目标字符的位置。此外,在不要求精确位置预测的下游任务中应用 TIPA,仍能提升需要字符级信息的任务性能,验证了其广泛性和有效性。

关键词

引用

@article{arxiv.2411.17679,
  title  = {Enhancing Character-Level Understanding in LLMs through Token Internal Structure Learning},
  author = {Zhu Xu and Zhiqiang Zhao and Zihan Zhang and Yuchi Liu and Quanwei Shen and Fei Liu and Yu Kuang and Jian He and Conglin Liu},
  journal= {arXiv preprint arXiv:2411.17679},
  year   = {2025}
}

备注

ACL 2025 Main