中文

走在他人的脚步:从视角迁移如何指导大语言模型减少有害内容和偏见

计算与语言 2024-07-23 v1 人工智能 计算机与社会

摘要

大语言模型 (LLM) 生成内容中的常见有害内容和社会偏见 necessitates strategies to reduce harm。现有的解决方案通常需要对模型拥有白盒访问权限或大量训练,这对于最新的商业 LLM 来说是不可行的。此外,现有的提示方法依赖于外部工具反馈,无法同时减少有害内容和偏见。鼓励社交心理学原理,我们提出了一种新策略,称为 perspective-taking prompting (PeT),该策略激发 LLM 整合多样化人类视角并自我调节其响应。这种自我纠正机制显著降低了 LLM 生成内容中的有害内容(最高可降低 89%)和偏见(最高可降低 73%)。对两种商业 LLM(ChatGPT 和 GLM)和三种开源 LLM 进行严格评估和消融研究,揭示了 PeT 在产生较少有害响应方面的优势,超过五个强大的基线方法。

关键词

引用

@article{arxiv.2407.15366,
  title  = {Walking in Others' Shoes: How Perspective-Taking Guides Large Language Models in Reducing Toxicity and Bias},
  author = {Rongwu Xu and Zi'an Zhou and Tianwei Zhang and Zehan Qi and Su Yao and Ke Xu and Wei Xu and Han Qiu},
  journal= {arXiv preprint arXiv:2407.15366},
  year   = {2024}
}