中文

探究基于 LLM 的偏见检测中的偏差:LLM 与人类感知之间的差异

计算机与社会 2024-12-11 v2

摘要

社交媒体中错误信息与虚假信息的普遍传播凸显了检测媒体偏见的关键重要性。尽管强大的大型语言模型已作为偏见预测的基础工具出现,但对这些模型内在偏差的担忧依然存在。在本研究中,我们调查了 LLM 内部偏差的存在与性质及其对媒体偏见检测的 consequential 影响。有别于仅关注媒体内容中偏见检测的传统方法,我们深入探讨了 LLM 系统本身的偏差。通过细致的审查,我们探究了 LLM 是否表现出偏差,特别是在政治偏见预测和文本续接任务中。此外,我们探索了不同主题间的偏差,旨在揭示 LLM 框架内偏差表达的细微差异。重要的是,我们提出了包括提示工程和模型微调在内的去偏策略。对不同 LLM 偏差倾向的广泛分析揭示了语言模型中偏差传播的更广泛图景。本研究推进了我们对 LLM 偏差的理解,为其对偏见检测任务的影响提供了关键见解,并为构建更稳健、更公平的 AI 系统铺平了道路。

关键词

引用

@article{arxiv.2403.14896,
  title  = {Investigating Bias in LLM-Based Bias Detection: Disparities between LLMs and Human Perception},
  author = {Luyang Lin and Lingzhi Wang and Jinsong Guo and Kam-Fai Wong},
  journal= {arXiv preprint arXiv:2403.14896},
  year   = {2024}
}

备注

COLING 2025