大语言模型自去偏:刻板印象的零样本识别与消减
计算与语言
2024-02-06 v1 人工智能
计算机与社会
机器学习
摘要
大语言模型(LLMs)在语言生成与理解方面展现出了显著进步,但也容易表现出有害的社会偏见。尽管对这些行为的认识催生了大量的偏见缓解技术,但大多数技术需要对训练数据、模型参数或解码策略进行修改,在没有可训练模型访问权限的情况下,这可能是不可行的。在本工作中,我们利用 LLMs 的零样本能力来减少刻板印象,提出了一种我们称之为零样本自去偏的技术。通过两种方法——基于解释的自去偏和基于重新提示的自去偏——我们表明,自去偏可以在仅依赖 LLM 本身和一个简单提示的情况下,显著降低九个不同社会群体中的刻板印象程度,其中解释能正确识别无效假设,而重新提示则能带来最大的偏见消减。我们希望这项工作能开启对其他零样本偏见缓解技术的探索。
引用
@article{arxiv.2402.01981,
title = {Self-Debiasing Large Language Models: Zero-Shot Recognition and Reduction of Stereotypes},
author = {Isabel O. Gallegos and Ryan A. Rossi and Joe Barrow and Md Mehrab Tanjim and Tong Yu and Hanieh Deilamsalehy and Ruiyi Zhang and Sungchul Kim and Franck Dernoncourt},
journal= {arXiv preprint arXiv:2402.01981},
year = {2024}
}