何时调用:通过毒性评估优化LLM公平性
计算与语言
2026-01-15 v1
摘要
大型语言模型(LLM)越来越多地用于在线审核系统中的毒性评估,其中不同人口群体间的公平性对于公平对待至关重要。然而,LLM对细微表达通常会产生不一致的毒性判断,特别是涉及隐性仇恨言论的表达,这揭示了难以通过标准训练纠正的潜在偏见。这引出了一个现有方法常忽略的关键问题:何时应调用纠正机制以确保公平可靠的评估?为解决此问题,我们提出了FairToT,一个通过提示引导的毒性评估来增强LLM公平性的推理时框架。FairToT识别出可能发生人口统计相关变化的情形,并决定何时应用额外评估。此外,我们引入了两个可解释的公平性指标,它们能检测此类情形并在不修改模型参数的情况下提高推理一致性。在基准数据集上的实验表明,FairToT减少了群体层面的差异,同时保持了稳定可靠的毒性预测,这表明推理时优化为基于LLM的毒性评估系统提供了一种有效且实用的公平性改进方法。源代码可在https://aisuko.github.io/fair-tot/ 获取。
引用
@article{arxiv.2601.09250,
title = {When to Invoke: Refining LLM Fairness with Toxicity Assessment},
author = {Jing Ren and Bowen Li and Ziqi Xu and Renqiang Luo and Shuo Yu and Xin Ye and Haytham Fayek and Xiaodong Li and Feng Xia},
journal= {arXiv preprint arXiv:2601.09250},
year = {2026}
}
备注
Accepted by Findings of WWW 2026