中文

通过测试时间对抗者提升LLM公平性

计算与语言 2025-05-20 v1 人工智能

摘要

大型语言模型(LLM)在自然语言处理和生成式AI领域推动了边界突破,推动了现代社会各方面的进展。不幸的是,LLM响应(即预测)中存在偏见的问题仍然是一个显著且开放的挑战,阻碍了其在涉及伦理敏感性和负责任决策的任务中的应用。在本工作中,我们提出了一种简单、用户友好且实用的方法来缓解此类偏见,增强LLM的可靠性和可信度。该方法通过修改特定属性来创建给定句子的多个变体,并评估相应预测行为与原始未修改预测/句子的比较。此过程背后的思想是,关键伦理预测往往 exhibits 显著不一致性,表明存在偏见。不同于以往方法,我们的方法仅依赖前向传递(即测试时间对抗者),无需训练、微调或了解训练数据分布。通过对流行的Llama系列进行大量实验,我们展示了该方法在改善各种公平性指标方面的有效性,重点关注减少模型对不同种族群体的待遇差异。具体而言,使用标准指标,我们在Llama3的公平性提升了最高可达27个百分点。总体而言,我们的方法在无需参数调优或训练数据修改的情况下显著增强了LLM生成结果的公平性、平等和可靠性,确认了其在实际场景中的有效性。我们认为本工作为使LLM在需要伦理考虑和负责任决策的任务中使用奠定了重要基础。

关键词

引用

@article{arxiv.2505.12100,
  title  = {Improving Fairness in LLMs Through Testing-Time Adversaries},
  author = {Isabela Pereira Gregio and Ian Pons and Anna Helena Reali Costa and Artur Jordão},
  journal= {arXiv preprint arXiv:2505.12100},
  year   = {2025}
}