中文

多义性还是一词多义?词汇同一性混淆了叠加度量

计算与语言 2026-04-02 v1 人工智能

摘要

如果同一个神经元对"lender"和"riverside"都产生激活,标准度量将这种重叠归因于叠加——该神经元必须在压缩两个不相关的概念。本工作探讨了重叠有多少源于词汇混淆:神经元因共享的词形(如"bank")而激活,而非因两个被压缩的概念。2×2 因子分解揭示,在跨越 110M–70B 参数的模型中,纯词汇条件(相同词形、不同含义)始终超过纯语义条件(不同词形、相同含义)。该混淆因素延续到稀疏自编码器中(18–36% 的特征混合了不同义项),位于 ≤1% 的激活维度内,并损害下游任务:过滤掉它可提升词义消歧效果,并使知识编辑更具选择性(p = 0.002)。

关键词

引用

@article{arxiv.2604.00443,
  title  = {Polysemanticity or Polysemy? Lexical Identity Confounds Superposition Metrics},
  author = {Iyad Ait Hou and Rebecca Hwa},
  journal= {arXiv preprint arXiv:2604.00443},
  year   = {2026}
}

备注

21 pages