中文

从Token推测LLM中文训练数据污染

计算与语言 2025-10-01 v2

摘要

Token是LLM训练数据集中的基本元素。众所周知,在GPT(4o/4o-mini/o1/o3/4.5/4.1/o4-mini)的词表中,许多代表中文短语的token指示了色情或网络赌博等内容。基于这一观察,我们的目标是在LLM中定位受污染的中文(Polluted Chinese, PoC)token,并研究PoC token的存在与训练数据之间的关系。(1) 我们基于GPT的词表给出了PoC token的正式定义和分类法。(2) 我们通过微调一个LLM来构建PoC token检测器,该检测器通过考虑每个token的语义和来自搜索引擎的相关内容来标记词表中的PoC token。(3) 我们通过PoC token的出现(token ID)研究对训练数据污染的推测。在GPT和其他23个LLM上的实验表明,这些token广泛存在,而GPT的词表表现最差:超过23%的较长中文token(即包含两个以上汉字的token)是色情或网络赌博。我们在C4和Pile等著名的预训练数据集上验证了我们推测方法的准确性。然后,考虑GPT-4o,我们推测GPT-4o训练数据中与“波多野结衣”相关的网页比例约为0.5%。

关键词

引用

@article{arxiv.2508.17771,
  title  = {Speculating LLMs' Chinese Training Data Pollution from Their Tokens},
  author = {Qingjie Zhang and Di Wang and Haoting Qian and Liu Yan and Tianwei Zhang and Ke Xu and Qi Li and Minlie Huang and Hewu Li and Han Qiu},
  journal= {arXiv preprint arXiv:2508.17771},
  year   = {2025}
}