中文

隐性偏见:语言模型中社会观点对隐性与显性观点的不一致程度

计算与语言 2024-08-19 v2 计算机与社会

摘要

尽管近年来已研究了多种偏见识别方法,但关于不明确表达观点的隐性语言如何影响大语言模型中的偏见放大,人们知之甚少。为了检验对某一观点的偏见严重程度,我们评估了两个下游任务,其中使用了隐性与显性的社会群体知识。首先,我们通过使用有偏模型在过度偏见场景的边界案例中进行压力测试评估。然后,我们评估大语言模型在面临与冲突观点一致的对立观点时,如何在语言层面对隐性与显性意见进行校准。我们的发现揭示了大语言模型在识别隐性与显性观点方面的性能差异,总体上存在偏向显性对立观点的偏见倾向。此外,与未对齐(零样本)基础模型相比,与偏见对齐的模型使用不确定性短语生成了更为谨慎的回应。未对齐模型的直接、鲁莽回应表明,需要通过引入不确定性标记来进一步改进其决断力,尤其是在具有高度主观性的社会细微话题上,以增强其可靠性。

关键词

引用

@article{arxiv.2408.08212,
  title  = {Covert Bias: The Severity of Social Views' Unalignment in Language Models Towards Implicit and Explicit Opinion},
  author = {Abeer Aldayel and Areej Alokaili and Rehab Alahmadi},
  journal= {arXiv preprint arXiv:2408.08212},
  year   = {2024}
}

备注

This work is under-review