中文

对齐的大型语言模型是否仍然存在误差?

计算与语言 2026-02-13 v1

摘要

大型语言模型(LLM)的误差源于模型行为与人类期望不一致,无法同时满足安全、价值和文化维度,而这些维度必须在现实环境中共存以解决实际查询。现有的误差基准测试——例如INSECURE CODE(以安全为中心)、VALUEACTIONLENS(以价值为中心)和CULTURALHERITAGE(以文化为中心)——依赖在单个维度上评估误差,无法同时进行评估。为克服这一差距,我们引入了Mis-Align Bench,这是一个用于分析安全、价值和文化维度误差的统一基准测试。首先我们构建了SAVACU,一个包含382,424个样本、跨越112个领域(或标签)的英文误差对齐数据集,通过将来自LLM-PROMPT-DATASET的提示按14个安全领域、56个价值领域和42个文化领域进行分类,并使用Mistral-7B-Instruct-v0.3进行扩展,后者通过Llama-3.1-8B-Instruct配合SimHash指纹以避免重复。进一步地,我们通过两阶段拒绝抽样将提示与误差响应和对齐响应配对,以确保质量。其次我们对通用、微调和开源权重LLM进行基准测试,实现了在三个维度下的误差系统评估。经验上,单维度模型在覆盖率最高可达97.6%,但在联合条件下产生的假失效率>50%,且对齐评分低于63%-66%。

关键词

引用

@article{arxiv.2602.11305,
  title  = {Are Aligned Large Language Models Still Misaligned?},
  author = {Usman Naseem and Gautam Siddharth Kashyap and Rafiq Ali and Ebad Shabbir and Sushant Kumar Ray and Abdullah Mohammad and Agrima Seth},
  journal= {arXiv preprint arXiv:2602.11305},
  year   = {2026}
}