中文

FairMT-Bench: 面向多轮对话大语言模型的公平性基准测试

计算与语言 2025-06-11 v2

摘要

基于大语言模型的聊天机器人日益普及,引发了对其公平性的担忧。大语言模型中的公平性问题可能导致严重后果,例如偏见放大、歧视以及对边缘化群体的伤害。现有的公平性基准测试主要关注单轮对话,而实际上更能反映真实对话场景的多轮对话,由于对话复杂性和潜在的偏见累积,带来了更大的挑战。在本文中,我们提出了一个面向多轮对话场景中大语言模型的综合性公平性基准测试——FairMT-Bench。具体来说,我们制定了一个任务分类体系,针对大语言模型在三个阶段的公平性能力:上下文理解、用户交互和指令权衡,每个阶段包含两个任务。为确保覆盖多样的偏见类型和属性,我们借鉴了现有的公平性数据集,并采用我们的模板构建了一个多轮对话数据集 FairMT-10K。在评估方面,我们应用了 GPT-4,以及包括 Llama-Guard-3 在内的偏见分类器和人工验证,以确保鲁棒性。在 FairMT-10K 上的实验和分析表明,在多轮对话场景中,当前的大语言模型更有可能生成有偏见的回复,并且不同任务和模型之间的性能存在显著差异。基于此,我们整理了一个具有挑战性的数据集 FairMT-1K,并在该数据集上测试了 15 个当前最先进的大语言模型。结果展示了当前大语言模型的公平性现状,并展示了这种新方法在更真实的多轮对话环境中评估公平性的实用性,呼吁未来的工作关注大语言模型公平性的改进,并在此类工作中采用 FairMT-1K。

关键词

引用

@article{arxiv.2410.19317,
  title  = {FairMT-Bench: Benchmarking Fairness for Multi-turn Dialogue in Conversational LLMs},
  author = {Zhiting Fan and Ruizhe Chen and Tianxiang Hu and Zuozhu Liu},
  journal= {arXiv preprint arXiv:2410.19317},
  year   = {2025}
}

备注

ICLR 2025 spotlight