Prompt Fairness: LLM中子群差异
机器学习
2025-11-26 v1 信息论
math.IT
摘要
大型语言模型 (LLM) 虽然在许多应用中显示出有效性,但在其响应质量方面存在显著差异。本文调查了这种提示公平性问题:具体而言,不同用户/风格下的提示措辞,尽管以相同问题提出,可能仍会引发 LLM 的不同响应。为量化这种差异,我们提出使用信息论指标来捕捉两个维度的偏差:子群灵敏度,即同一子群内响应的可变性;跨群一致性,即跨子群响应的可变性。我们的分析表明,某些子群同时表现出更高的内部可变性和更大与其他子群的差异。我们的实证分析揭示,某些人口统计子群同时经历更高的内部可变性和更大的与其他子群的差异,表明模型行为中存在结构性不公。为缓解这些差异,我们提出实用干预措施,包括跨多个生成的多数投票和提示中和,两者共同改善了响应稳定性并增强了跨用户群体的公平性。在实验中,我们观察到不同人口统计子群之间存在明显的提示敏感性差异:在缓解措施之前,跨群差异值达到0.28,通常在0.14至0.22范围内。在应用我们的中和和多生成策略后,这些差异一致下降,其中最大的差距降至0.22,许多距离降至0.17以下,表明输出在子群之间更稳定且更一致。
引用
@article{arxiv.2511.19956,
title = {Prompt Fairness: Sub-group Disparities in LLMs},
author = {Meiyu Zhong and Noel Teku and Ravi Tandon},
journal= {arXiv preprint arXiv:2511.19956},
year = {2025}
}