中文

语言模型中的文化绑定头

人工智能 2026-05-28 v1 计算与语言 机器学习

摘要

大语言模型 (LLM) 常默认等对待不同文化群体,尽管情境可能需要区分:这表现为缺乏差异意识。我们运用机制可解释性方法并对 N4 文化侵权基准(Wang 等 2025)进行因子设计,识别出每种模型中 2-3 个中层注意力头对文化绑定具有因果贡献。文化绑定是将文化项目与相应身份关联的过程。 knockout 这些头上的 identity-to-item 边缘可使绑定强度下降 9-23%。所识别的头在 instruct 与 base 模型间可迁移,表明文化绑定在预训练阶段即被创建。α\alpha 扩展显示剂量-反应分层,生成时的 moderate 放大引导 (α=23\alpha = 2-3) 可使文化区分度准确率提高 1-3 个百分点,同时基本保持中性推理完整。知识探测任务显示模型实际了解的知识是其行为的 3-5 倍,表明瓶颈在于路由而非知识本身。

关键词

引用

@article{arxiv.2605.28543,
  title  = {Cultural Binding Heads in Language Models},
  author = {Avrile Floro and Luca Benedetto},
  journal= {arXiv preprint arXiv:2605.28543},
  year   = {2026}
}