通过反思型大语言模型揭示偏见
人工智能
2024-10-25 v2 计算与语言
机器学习
摘要
人类标记数据中的偏见和错误为机器学习带来了重大挑战,尤其是依赖可能带有缺陷的真实标签数据的监督学习。在使用最大似然估计训练模型时,这些缺陷(包括诊断错误和社会偏见)可能被放大。我们提出了反思型大语言模型对话框架(RLDF),该框架利用多个单个 LLM 或不同 LLM 之间的结构化对抗对话,以揭示多样视角并纠正不一致性。通过使 LLM 采用对立立场,RLDF 能够通过条件统计、信息论和散度指标进行系统偏见检测。实验表明,RLDF 成功识别了公共内容中的潜在偏见,同时暴露了人类标记数据中的局限性。我们的框架支持可衡量的进展跟踪和可解释的纠正措施,提供了一种可扩展的方法,通过透明的多视角分析提高内容中性。
引用
@article{arxiv.2408.13464,
title = {Uncovering Biases with Reflective Large Language Models},
author = {Edward Y. Chang},
journal= {arXiv preprint arXiv:2408.13464},
year = {2024}
}
备注
18 pages, 4 figures, 9 tables