无外部表达的内部知识:经典中文语言模型泛化边界的探针
计算与语言
2026-04-17 v1 人工智能
摘要
我们从头训练了一个参数为 3180 万的 Transformer 语言模型,仅使用156亿token的纯古文语料构建,严格不包含英文字符或阿拉伯数字。通过系统性的离分布(OOD)测试,我们探讨了该模型是否能够区分已知与未知输入,关键问题是其生成文本是否能够表达这种区分。我们发现,内部与外部不确定性之间存在明显的分离。内部方面,模型在真实历史事件与虚构历史事件之间显示出2.39倍的困惑度比率(p = 8.9e-11,n = 92);半虚构事件(真实人物+虚构事件)的困惑度最高,达4.24倍(p = 1.1e-16),表明其对事实编码超越语法模式匹配具有真实认知。外部方面则从未学习到表达不确定性:古文语料中表现出不确定性的语言标记,在 OOD 问题中的出现率为3.5%,低于分布内问题的8.3%(p = 0.023),反映的是修辞惯例而非真正的元认知。我们在三种语言(古文、英语、日文)、三种书写系统以及从1.1亿到1.56亿参数的八个模型中复制了这两种发现。进一步表明,表达不确定性的频率完全由训练数据惯例决定,古文模型呈现\emph{谦逊悖论”(对已知主题更谦逊),而日文模型几乎从不 hedge。我们认为,元认知表达——即\emph{说我不知道”的能力——并非仅凭语言建模即可产生,而需要诸如 RLHF 等显式训练信号。
引用
@article{arxiv.2604.14180,
title = {Internal Knowledge Without External Expression: Probing the Generalization Boundary of a Classical Chinese Language Model},
author = {Jiuting Chen and Yuan Lian and Hao Wu and Tianqi Huang and Hiroshi Sasaki and Makoto Kouno and Jongil Choi},
journal= {arXiv preprint arXiv:2604.14180},
year = {2026}
}
备注
15 pages, 5 figures, supplementary material included