CoBia:构造对话可触发 LLM 中潜伏的社会偏见
计算与语言
2025-10-14 v1
摘要
模型构建的改进,包括加固的安全防护措施,使得大型语言模型 (LLM) 越来越能够通过标准安全检测。然而,LLM 在对话中有时会泄露有害行为,例如表达种族主义观点。为系统分析这一现象,我们引入 CoBia,一个轻量级对抗性攻击套件,允许我们细化 LLM 在对话中偏离规范或伦理行为的条件范围。CoBia 创建一个构造性对话,其中模型对某个社会群体提出偏见观点。我们随后评估模型能否从该虚构的偏见主张中恢复,并拒绝偏见性的后续问题。我们评估了 11 个开源及专有 LLM,其输出涉及六个与个体安全和公平对待相关的社会人口学类别,即性别、种族、宗教、国籍、性取向以及其他类别。我们的评估基于既定的 LLM 偏见指标,并将结果与人类判断进行比较,以描绘 LLM 的可靠性和对齐程度。结果表明, purposefully 构造的对话可可靠地揭示偏见放大,LLM 在对话中常常无法拒绝偏见性的后续问题。这一形式的压力测试凸显了可以通过交互暴露的深植偏见。代码和资源可在 https://github.com/nafisenik/CoBia 获取。
引用
@article{arxiv.2510.09871,
title = {CoBia: Constructed Conversations Can Trigger Otherwise Concealed Societal Biases in LLMs},
author = {Nafiseh Nikeghbal and Amir Hossein Kargaran and Jana Diesner},
journal= {arXiv preprint arXiv:2510.09871},
year = {2025}
}
备注
EMNLP 2025 (Oral)