探究基于推理的语言模型在社交偏见缓解中的思考行为
计算与语言
2026-05-13 v2 人工智能
摘要
尽管基于推理的大型语言模型通过内部结构化的思考过程在复杂任务中表现卓越,但近期出现的现象是,这种思考过程会聚合社会刻板印象,导致偏见结果。然而,这些语言模型在社交偏见情境下的底层行为仍未得到充分探索。本文系统性地研究了这种现象背后思考过程中的机制,发现两种驱动社交偏见聚合的失败模式:1) 刻板印象重复,即模型以社会刻板印象为主要依据;2) 无关信息注入,即模型编造或引入新细节来支持偏见叙事。基于这些发现,我们引入一种轻量级基于提示的缓解方法,通过查询模型对自身初始推理以反思的方式,以针对这些特定的失败模式进行检验。在针对问答任务(BBQ 和 StereoSet)和开放式任务(BOLD)的实验中,我们的方法有效减少了偏见,同时保持或提升了准确率。
引用
@article{arxiv.2510.17062,
title = {Investigating Thinking Behaviours of Reasoning-Based Language Models for Social Bias Mitigation},
author = {Guoqing Luo and Iffat Maab and Lili Mou and Junichi Yamagishi},
journal= {arXiv preprint arXiv:2510.17062},
year = {2026}
}
备注
Due to issues found with the annotations in Section 4.3, we have decided to withdraw this preprint