使用对比输入解码揭示大语言模型中的偏差
计算与语言
2023-05-15 v1 计算机与社会
机器学习
摘要
确保大语言模型(LM)公平、鲁棒且有用,需要理解对其输入的不同修改如何影响模型行为。然而,在开放文本生成任务的背景下,此类评估并非易事。例如,当向模型输入一段文本及其扰动的“对比”版本时,标准解码策略可能无法揭示下一词预测中有意义的差异。出于此动机,我们提出对比输入解码(CID):一种给定两个输入生成文本的解码算法,其中生成的文本对一个输入而言是可能的,对另一个输入而言则不太可能。以此方式,对比生成可以以简单且可解释的方式突出LM针对两个输入的输出可能存在的微妙差异。我们使用CID来突出标准解码策略难以检测的上下文特定偏差,并量化不同输入扰动的影响。
引用
@article{arxiv.2305.07378,
title = {Surfacing Biases in Large Language Models using Contrastive Input Decoding},
author = {Gal Yona and Or Honovich and Itay Laish and Roee Aharoni},
journal= {arXiv preprint arXiv:2305.07378},
year = {2023}
}