面向文化本土化生成的 LLM 控制技术
计算与语言
2026-03-25 v1
摘要
大语言模型 (LLM) 在全球范围内部署,但产生的响应偏向于训练数据丰富的文化。现有的文化本土化方法,如提示词工程或后训练对齐,作为黑盒操作难以控制,且无法判断失败是源于缺乏知识还是误导效果。在本文中,我们利用机制性解释技术揭示并操控 LLM 中的文化表征。借助稀疏自编码器,我们识别编码文化相关信息的可解释特征,并将其聚合为文化嵌入 (Cultural Embeddings, CuE)。我们既用于分析在表述不清晰的提示词下的隐式文化偏见,也用于构建白盒控制干预。我们在多个模型上表明,基于 CuE 的控制方法提高了文化忠实度,并显著引导模型生成更稀有、长尾文化概念,优于仅使用提示词。值得注意的是,基于 CuE 的控制方法与黑盒本土化方法是互补的,能够在提示词增强输入之上实现额外提升。这也表明模型从受控的 elicitation 策略中受益,尚未必然缺乏长尾知识表征,尽管不同文化之间的表现存在差异。我们的结果既为 LLM 中的文化表征提供诊断性见解,也提供了可控的方法以实现对特定文化的引导。
引用
@article{arxiv.2603.23301,
title = {Steering LLMs for Culturally Localized Generation},
author = {Simran Khanuja and Hongbin Liu and Shujian Zhang and John Lambert and Mingqing Chen and Rajiv Mathews and Lun Wang},
journal= {arXiv preprint arXiv:2603.23301},
year = {2026}
}
备注
preprint