通过潜在激活引导实现文化价值对齐
计算与语言
2026-05-27 v1
摘要
大型语言模型(LLMs)常表现出同质化的文化视角。虽然世界价值调查(WVS)为映射人类价值观提供了黄金标准,但传统对 LLMs 直接进行 WVS 提示往往无法访问模型的潜在文化深度,导致 safety-aligned 拒绝或中性响应。本文提出一种通用的用于文化评估和干预的框架,从抽象查询转向情境基于的行为探测。通过提取 300 个情境困境中的隐式 token 概率,我们绕过表面层的对齐以映射 LLMs 文化价值的潜在坐标。我们进一步引入激活引导,在前向传播期间无需重新训练即可转移这些内部对齐。跨多个 LLMs,我们发现适应性存在显著差异,并揭示了一种一致的潜在偶联现象,即沿一个文化维度的干预会引发沿另一个维度的偏移。这些结果表明文化价值编码为耦合结构,限制了精确对齐。本工作建立了一个计算高效的文化引导框架,突显了在 LLMs 中处理全球价值观的结构复杂性。
引用
@article{arxiv.2605.26365,
title = {Cultural Value Alignment Via Latent Activation Steering in Large Language Models},
author = {Trung Duc Anh Dang and Sarah Masud},
journal= {arXiv preprint arXiv:2605.26365},
year = {2026}
}
备注
ACL 2026 Student Research Workshop (Non-Archival Track)