中文

通过思维链提示评估大型语言模型中的性别偏见

计算与语言 2024-01-30 v1

摘要

存在可扩展任务(如阅读理解和事实核查),其中模型性能随模型规模增大而提高;也存在不可扩展任务(如算术推理和符号推理),其中模型性能不一定随模型规模增大而提高。配备思维链 (CoT) 提示的大型语言模型 (LLMs) 即使在不可扩展任务上也能做出准确的增量预测。不幸的是,尽管 LLMs 具有卓越的推理能力,但它们倾向于内化并重现歧视性的社会偏见。CoT 是否能为不可扩展任务中的隐含信息提供歧视性或平等主义的合理化解释,仍是一个悬而未决的问题。在本研究中,我们考察了 LLMs 的逐步预测对不可扩展任务中性别偏见的影响。为此,我们构建了一个不可扩展任务的基准,其中 LLM 被给予一个包含女性化、男性化和性别化职业词汇的列表,并被要求统计女性化和男性化词汇的数量。在我们的 CoT 提示中,我们要求 LLM 在做出最终预测之前明确指出单词列表中的每个词是女性化还是男性化。通过计数和处理单词含义,该基准兼具算术推理和符号推理的特征。英文实验结果表明,在没有逐步预测的情况下,尽管任务简单如计数单词,大多数 LLMs 仍会做出具有社会偏见的预测。有趣的是,CoT 提示减少了 LLMs 中这种无意识的社会偏见,并鼓励公平的预测。

关键词

引用

@article{arxiv.2401.15585,
  title  = {Evaluating Gender Bias in Large Language Models via Chain-of-Thought Prompting},
  author = {Masahiro Kaneko and Danushka Bollegala and Naoaki Okazaki and Timothy Baldwin},
  journal= {arXiv preprint arXiv:2401.15585},
  year   = {2024}
}