语言模型中的文化绑定头
人工智能
2026-05-28 v1 计算与语言
机器学习
摘要
大语言模型 (LLM) 常默认等对待不同文化群体,尽管情境可能需要区分:这表现为缺乏差异意识。我们运用机制可解释性方法并对 N4 文化侵权基准(Wang 等 2025)进行因子设计,识别出每种模型中 2-3 个中层注意力头对文化绑定具有因果贡献。文化绑定是将文化项目与相应身份关联的过程。 knockout 这些头上的 identity-to-item 边缘可使绑定强度下降 9-23%。所识别的头在 instruct 与 base 模型间可迁移,表明文化绑定在预训练阶段即被创建。 扩展显示剂量-反应分层,生成时的 moderate 放大引导 () 可使文化区分度准确率提高 1-3 个百分点,同时基本保持中性推理完整。知识探测任务显示模型实际了解的知识是其行为的 3-5 倍,表明瓶颈在于路由而非知识本身。
引用
@article{arxiv.2605.28543,
title = {Cultural Binding Heads in Language Models},
author = {Avrile Floro and Luca Benedetto},
journal= {arXiv preprint arXiv:2605.28543},
year = {2026}
}