大型语言模型能否让每个人都幸福?
计算与语言
2026-02-12 v1
摘要
大型语言模型(LLM)中的对齐问题指的是在现实场景中,这些维度(安全、价值和文化)必须共存,但模型行为却偏离人类期望的现象。现有的基准测试,如以安全为中心的 SAFETUNEBED、以价值观为中心的 VALUEBENCH 和以文化为中心的 WORLDVIEW-BENCH,主要在孤立的情况下评估这些维度,因而无法提供关于这些维度之间相互作用和权衡的充分见解。更近期的努力,如 MIB 和基于机制可解释性的基准测试,提供了关于模型失败的有价值的视角;但它们仍不足以系统性地刻画跨维度的权衡。为填补这些差距,我们引入了 MisAlign-Profile,这是一个受机制轮廓启发的统一基准,用于衡量对齐失效的权衡。首先,我们构建了 MISALIGNTRADE,这是一个横跨 112 个规范领域分类学(包括 14 个安全、56 个价值和 42 个文化领域)的英文误差-对齐数据集。除了领域标签之外,每个提示还被分类为一种三种正交语义类型中的一种——对象、属性或关系误差——并使用 Gemma-2-9B-it 进行分类,通过 Qwen3-30B-A3B-Instruct-2507 扩展,并采用 SimHash 基于指纹的方法以避免重复。每个提示都配有误差响应和对齐响应,通过两阶段拒绝抽样以确保质量。我们对通用、微调和开源 LLM 在 MISALIGNTRADE 上的基准测试,揭示了在不同维度之间存在 12%~34% 的误差权衡。
引用
@article{arxiv.2602.11091,
title = {Can Large Language Models Make Everyone Happy?},
author = {Usman Naseem and Gautam Siddharth Kashyap and Ebad Shabbir and Sushant Kumar Ray and Abdullah Mohammad and Rafiq Ali},
journal= {arXiv preprint arXiv:2602.11091},
year = {2026}
}