中文

个性化还是偏见?利用大语言模型中的去偏调谐解决仇恨言论检测中的地域偏见

计算与语言 2025-05-06 v1

摘要

商业大语言模型(LLM)最近集成了记忆功能以提供个性化响应。该记忆保留了用户人口统计信息和个人特征等细节,使LLM能够根据个人信息调整其行为。然而,将个性化信息整合到上下文中的影响尚未得到充分评估,导致对其对LLM行为影响的质疑。个性化可能具有挑战性,尤其是在敏感话题上。在本文中,我们研究了各种最先进的LLM,以了解它们在不同个性化场景下的行为,特别关注仇恨言论。我们提示模型假设国家特定人设,并使用不同语言进行仇恨言论检测。我们的发现表明,上下文个性化显著影响LLM在这一敏感领域的响应。为了减轻这些不需要的偏见,我们通过惩罚在使用和不使用国家或语言特定上下文时做出的不一致仇恨言论分类来微调LLM。优化后的模型在个性化上下文和无上下文场景中均表现出改进的性能。

关键词

引用

@article{arxiv.2505.02252,
  title  = {Personalisation or Prejudice? Addressing Geographic Bias in Hate Speech Detection using Debias Tuning in Large Language Models},
  author = {Paloma Piot and Patricia Martín-Rodilla and Javier Parapar},
  journal= {arXiv preprint arXiv:2505.02252},
  year   = {2025}
}