中文

AdaCultureSafe:基于文化知识的自适应文化安全大型语言模型

计算与语言 2026-03-10 v1 人工智能

摘要

随着大型语言模型(LLM)的广泛采用,尊重原住民文化已成为模型文化安全和负责任全球应用的关键。现有研究分别考虑文化安全和文化知识,忽视了前者应以后者为基础。这严重阻碍了LLM生成具有文化特定尊重性的响应。因此,自适应文化安全仍是一个巨大的挑战。本文我们提出联合建模文化安全与知识。首先,文化安全与知识配对数据是开展此项研究的关键前提。然而,不同地区的文化多样性以及文化差异的微妙性为创建此类配对评估数据提出了重大挑战。为此,我们提出一种新型框架,将整合权威文化知识描述策录、LLM自动查询生成以及大量人工验证。据此,我们获得了名为AdaCultureSafe的数据集,包含4800个手动分解的细粒度文化描述,以及相应的48000个手动验证的安全性和知识导向查询。基于构建的数据集,我们评估了三个流行LLM家族在其文化安全和知识熟练度方面的表现,通过此我们发现:它们在文化安全和知识熟练度之间不存在显著相关性。我们进而深入研究LLM内部的神经激活,以探讨这种缺乏相关性的潜在原因,这可归因于预训练目标与后对齐目标的差异。最后,我们提出一种以知识为基础的方法,通过强制将知识集成到LLM响应生成过程中,从而显著提升文化安全。

关键词

引用

@article{arxiv.2603.08275,
  title  = {AdaCultureSafe: Adaptive Cultural Safety Grounded by Cultural Knowledge in Large Language Models},
  author = {Hankun Kang and Di Lin and Zhirong Liao and Pengfei Bai and Xinyi Zeng and Jiawei Jiang and Yuanyuan Zhu and Tieyun Qian},
  journal= {arXiv preprint arXiv:2603.08275},
  year   = {2026}
}