InsideOut:衡量与缓解访谈脚本生成中的内部者-外部者偏见
计算与语言
2026-04-22 v2 人工智能
计算机与社会
摘要
大型语言模型(LLM)的进步已促进了诸多下游应用,如故事和访谈脚本生成。但近期研究指出LLM生成内容中存在文化相关的公平性问题。在本工作中,我们识别并系统性地研究了LLM的内部者-外部者偏见,即模型在生成时将自己定位为主流文化的"内部者",而将较不主流文化外部化。我们提出了包含4000个生成提示的InsideOut基准测试,并设计了三个评估指标,通过文化嵌入式访谈脚本生成任务来量化此偏见——在该任务中,LLM被定位为针对10个多样化文化中当地人进行采访的记者。对5个最先进LLM的实证评估显示,模型在平均超过88%的美国情境脚本中采用内部者语调,同时对非西方文化倾向于默认"外部者"立场。为缓解这些偏见,我们提出了两种推理时方法:基于提示的公平干预柱(FIP)基线方法,以及结构化的通过公平代理人(MFA)框架的缓解方法,包括单一代理人(MFA-SA)、层次化代理人(MFA-HA)以及自主代理人规划(MFA-Plan)管道。实证结果表明,基于代理人的MFA方法在缓解内部者-外部者偏见方面取得卓越且稳健的性能:例如,在文化对齐偏差(CAG)指标上,MFA-SA使Llama模型的偏见降低了89.70%,MFA-HA使Qwen模型的偏见降低了82.54%。这些发现彰显了基于代理人的方法在缓解生成式LLM偏见方面的有效性。
引用
@article{arxiv.2509.21080,
title = {InsideOut: Measuring and Mitigating Insider-Outsider Bias in Interview Script Generation},
author = {Yixin Wan and Xingrun Chen and Kai-Wei Chang},
journal= {arXiv preprint arXiv:2509.21080},
year = {2026}
}