中文

被指令偏置:指令微调语言模型显现出涌现认知偏差

人工智能 2024-04-02 v2 计算机与社会 机器学习

摘要

近期研究表明,指令微调(IT)与基于人类反馈的强化学习(RLHF)显著提升了大语言模型(LM)的能力。尽管这些微调方法有助于将模型与人类目标对齐并生成高质量文本,但其潜在负面影响尚不为人所知。本工作中,我们研究 IT 与 RLHF 对 LM 决策与推理的影响,聚焦于三种认知偏差——诱饵效应、确定效应与信念偏差——它们均已知会影响人类决策与推理。我们的发现揭示了这些偏差存在于 GPT-3、Mistral 和 T5 系列的多类模型中。值得注意的是,我们发现经过指令微调的模型(如 Flan-T5、Mistral-Instruct、GPT3.5 和 GPT4)中偏差表现更强。我们的工作朝着理解指令微调 LM 中的认知偏差迈出了一步,这对开发更可靠且无偏的语言模型至关重要。

关键词

引用

@article{arxiv.2308.00225,
  title  = {Instructed to Bias: Instruction-Tuned Language Models Exhibit Emergent Cognitive Bias},
  author = {Itay Itzhak and Gabriel Stanovsky and Nir Rosenfeld and Yonatan Belinkov},
  journal= {arXiv preprint arXiv:2308.00225},
  year   = {2024}
}

备注

TACL 2024. Presented at ACL 2024. 12 pages