Machina N400:精确定位因果语言模型如何检测语义违规
计算与语言
2025-11-25 v1 人工智能
摘要
如何以及在何处发现一个句子语义上出现问题?为探索此问题,我们对因果语言模型(phi-2)进行评估,使用精心挑选的语料库,其中包含看似合理或不合理的结尾句子。我们的分析聚焦于每个模型层抽样的隐藏状态。为考察违规如何被编码,我们利用了两种互补的探针。首先,我们进行了逐层检测,使用线性探针。我们的发现表明,线性探针在模型最底层的三分之一难以区分合理与不合理的结尾。然而,其准确率在中间层显著提升,达到峰值位于靠近顶层之前。其次,我们检查了编码违规的有效维度。初始,违规会扩大表征子空间,随后在中段瓶颈后发生收缩。这可能指示一种从探索性阶段向快速整合过渡的过程。综上,这些结果与人类阅读中语义异常检测仅在语法解析完成后发生的经典心理语言学发现相吻合,后者在在线处理序列中发生于较晚时刻。
引用
@article{arxiv.2511.19232,
title = {In Machina N400: Pinpointing Where a Causal Language Model Detects Semantic Violations},
author = {Christos-Nikolaos Zacharopoulos and Revekka Kyriakoglou},
journal= {arXiv preprint arXiv:2511.19232},
year = {2025}
}
备注
Accepted at AICS2025