C2PO:诊断和解离LLM中的偏好捷径
计算与语言
2025-12-30 v1
摘要
大型语言模型(LLM)中的偏好构成了对可信度的重大风险,主要表现为刻板印象偏好(如性别或种族刻板印象)和结构性偏好(如词汇重叠或位置偏好)。然而,先前的范式通常以孤立方式处理这些问题,往往在缓解一种偏好而加剧另一种偏好方面存在困难。为此,我们系统性地探索了这些推理失效,并识别出一种主要诱因:输入中潜在的虚假特征相关性,这些相关性驱动了这些错误的推理捷径。基于这些发现,我们引入因果对比偏好优化(C2PO),一种统一的对齐框架,旨在针对这些具体失效进行处理,通过同时发现和抑制这些相关性直接在优化过程中。具体而言,C2PO利用因果反事实信号来隔离偏好诱导的特征与有效推理路径,并采用公平性敏感的偏好更新机制来动态评估logit层面的贡献并抑制捷径特征。广泛的实验覆盖了多个基准,包括刻板印象偏好(BBQ, Unqover)、结构性偏好(MNLI, HANS, Chatbot, MT-Bench)、域外公平性(StereoSet, WinoBias)以及通用实用性(MMLU, GSM8K),结果表明C2PO有效缓解了刻板印象和结构性偏好,同时保持了稳健的通用推理能力。
引用
@article{arxiv.2512.23430,
title = {C2PO: Diagnosing and Disentangling Bias Shortcuts in LLMs},
author = {Xuan Feng and Bo An and Tianlong Gu and Liang Chang and Fengrui Hao and Peipeng Yu and Shuai Zhao},
journal= {arXiv preprint arXiv:2512.23430},
year = {2025}
}