神经语言模型中涌现的词汇语义:在 LLM 生成文本上测试 Martin 定律
计算与语言
2025-11-27 v1
摘要
我们首次系统性地调查了 Martin 定律——即词频与多义性之间经验关系——在神经语言模型训练期间生成的文本中。我们采用 DBSCAN 对上下文化嵌入进行聚类,以 operationalize 词义sense。我们分析了四个 Pythia 模型(70M-1B 参数)在 30 个训练检查点上的情况。我们的结果显示出非单调的发展轨迹:Martin 定律在检查点 100 左右出现,在检查点 104 达到峰值相关性(r > 0.6),随后在检查点 105 开始下降。较小的模型(70M、160M)在晚期检查点经历语义崩溃,而较大的模型(410M、1B)显示出优雅的退化。频率-特异性权衡在所有模型中保持稳定(r ≈ -0.3)。这些发现表明,LLM 生成文本中语言规律的符合程度并非随训练单调增加,而是遵循平衡的轨迹,在最优语义窗口内达到最佳。本工作建立了评估神经语言模型涌现语言结构的新方法。
引用
@article{arxiv.2511.21334,
title = {Emergent Lexical Semantics in Neural Language Models: Testing Martin's Law on LLM-Generated Text},
author = {Kai Kugler},
journal= {arXiv preprint arXiv:2511.21334},
year = {2025}
}
备注
paper draft