专家引导的有毒令牌消除以实现去偏生成
计算与语言
2024-05-30 v1
摘要
大型语言模型(LLM)在生成过程中可能引发社会偏见,尤其是在使用有毒提示进行推理时。控制生成中的敏感属性面临数据分布、泛化性和效率方面的挑战。具体而言,微调和检索需要大量无偏语料库,而直接提示需要精心设计的指令以在多轮思考中纠正输出,但对内存和推理延迟构成挑战。在这项工作中,我们提出了专家引导的有毒令牌消除以实现去偏生成(EXPOSED),无需上述要求即可消除LLM的不良有害输出。EXPOSED基于丰富的有毒语料库构建了一个去偏专家,以暴露和引出潜在危险令牌。然后,它处理LLM的输出,并通过抑制和衰减有毒令牌来构建公平分布。EXPOSED在三个LLM家族的公平基准上进行了评估。大量实验表明,与其他基线相比,所提出的EXPOSED在平衡公平性和生成性能的同时,显著减少了潜在的社会偏见。
引用
@article{arxiv.2405.19299,
title = {Expert-Guided Extinction of Toxic Tokens for Debiased Generation},
author = {Xueyao Sun and Kaize Shi and Haoran Tang and Guandong Xu and Qing Li},
journal= {arXiv preprint arXiv:2405.19299},
year = {2024}
}