量化 LLM 在人权问题上的 hedging 与 non-affirmation 行为
计算机与社会
2026-04-08 v2 人工智能
社会与信息网络
摘要
hedging 和 non-affirmation 是大型语言模型(LLM)所表现出的行为,限制了对特定陈述的明确肯定。虽然在主观语境中这些行为是可取的,但在人权语境中是不可取的——人权应明确适用于所有群体。我们提出了一个系统性框架,用于衡量在围绕各种身份群体的无约束 LLM 回应中出现的这些行为。我们评估了六个大型专有模型以及一个开放权重 LLM,在 4738 个提示上进行测试,覆盖 205 个民族和无国籍民族身份,并发现 4 个模型显示出显著依赖于群体身份的 hedging 和 non-affirmation 行为。尽管冲突信号、主权(身份是否无国籍)或经济指标(GDP)也影响模型行为,但其效应大小始终弱于身份本身。这种系统性差异在重新表述提示的方法下仍然稳健。由于群体身份是这些行为的最强预测器,我们使用开放权重模型来探讨是否可以通过对这些群体身份应用引导和正交化技术来缓解 hedging 和 non-affirmation 行为的发生率。我们发现群体引导是跨查询类型最有效的去偏方法,且对下游遗忘具有稳健性。
引用
@article{arxiv.2502.19463,
title = {Hedging and Non-Affirmation: Quantifying LLM Alignment on Questions of Human Rights},
author = {Rafiya Javed and Cassandra Parent and Jackie Kay and David Yanni and Abdullah Zaini and Anushe Sheikh and Maribeth Rauh and Walter Gerych and Ramona Comanescu and Iason Gabriel and Marzyeh Ghassemi and Laura Weidinger},
journal= {arXiv preprint arXiv:2502.19463},
year = {2026}
}