中文

基于仿射属性的 LLM 对齐诊断——带有仇恨言论标注

计算与语言 2026-05-27 v1 多媒体

摘要

仇恨言论标注成本高昂、主观性强且易导致标注者间意见不一致,使得大规模数据集构建困难。我们系统性地分析了大语言模型(LLM)在跨十个从理论角度出发的主观属性(如去人格化、暴力、情感)上的对齐程度,评估了小型与大型 Llama 3.1 和 Qwen 2.5。我们的分析显示,所有模型均呈现一致的划分:行为显性维度(侮辱、羞辱、攻击-防御)与人类标注高度相关,而评估性维度(尊重、情感、仇恨言论)则被系统性地反转。人口学特征条件化会降低模型置信度,却未提升对齐效果。基于这些发现,我们提出通过置信度加权的 Ridge 回归组合属性级 LLM 预测,从而重建 Measuring Hate Speech 语料库中的连续仇恨言论分数,实现 R2R^2 最高可达 0.71,超越直接提示基线方法,表明结构化属性分解比端到端标签预测alone 更能恢复更贴近人类的信号。

关键词

引用

@article{arxiv.2605.27025,
  title  = {Attribute-Based Diagnosis of LLM Alignment with Hate Speech Annotations},
  author = {Mohammad Amine Jradi and Faeze Ghorbanpour and Alexander Fraser},
  journal= {arXiv preprint arXiv:2605.27025},
  year   = {2026}
}