中文

噪声中的信号:多义性干涉可迁移并预测跨模型影响

人工智能 2026-03-19 v3 计算与语言 密码学与安全

摘要

多义性在语言模型中普遍存在,并且仍然是模型解释和行为控制的主要挑战。我们利用稀疏自编码器(SAE),绘制了两个小型模型(Pythia-70M 和 GPT-2-Small)的多义性拓扑结构,以识别在语义上无关但在模型内部表现出干扰的 SAE 特征对。我们在四个焦点(提示、词元、特征、神经元)进行干预,并测量下一个词元预测分布中的诱导偏移,揭示了暴露这些模型系统性脆弱性的多义性结构。至关重要的是,从两个小型模型共享的反直觉干扰模式中提炼出的干预措施,能够可靠地迁移到更大的指令微调模型(Llama-3.1-8B/70B-Instruct 和 Gemma-2-9B-Instruct),在无需访问模型内部结构的情况下产生可预测的行为偏移。这些发现挑战了多义性纯粹是随机的观点,反而证明干扰结构可以跨规模和模型族泛化。这种泛化性暗示了一种收敛的、更高阶的内部表征组织,它仅与直觉弱对齐,并由潜在的规律性所构建,为黑盒控制和人类与人工认知的理论洞察提供了新的可能性。

关键词

引用

@article{arxiv.2505.11611,
  title  = {Signal in the Noise: Polysemantic Interference Transfers and Predicts Cross-Model Influence},
  author = {Bofan Gong and Shiyang Lai and James Evans and Dawn Song},
  journal= {arXiv preprint arXiv:2505.11611},
  year   = {2026}
}