被指令偏置:指令微调语言模型显现出涌现认知偏差
人工智能
2024-04-02 v2 计算机与社会
机器学习
摘要
近期研究表明,指令微调(IT)与基于人类反馈的强化学习(RLHF)显著提升了大语言模型(LM)的能力。尽管这些微调方法有助于将模型与人类目标对齐并生成高质量文本,但其潜在负面影响尚不为人所知。本工作中,我们研究 IT 与 RLHF 对 LM 决策与推理的影响,聚焦于三种认知偏差——诱饵效应、确定效应与信念偏差——它们均已知会影响人类决策与推理。我们的发现揭示了这些偏差存在于 GPT-3、Mistral 和 T5 系列的多类模型中。值得注意的是,我们发现经过指令微调的模型(如 Flan-T5、Mistral-Instruct、GPT3.5 和 GPT4)中偏差表现更强。我们的工作朝着理解指令微调 LM 中的认知偏差迈出了一步,这对开发更可靠且无偏的语言模型至关重要。
引用
@article{arxiv.2308.00225,
title = {Instructed to Bias: Instruction-Tuned Language Models Exhibit Emergent Cognitive Bias},
author = {Itay Itzhak and Gabriel Stanovsky and Nir Rosenfeld and Yonatan Belinkov},
journal= {arXiv preprint arXiv:2308.00225},
year = {2024}
}
备注
TACL 2024. Presented at ACL 2024. 12 pages