镜像中的偏见:LLM意见是否对其自身的对抗性攻击具有鲁棒性?
计算与语言
2024-11-06 v2 人工智能
摘要
大语言模型(LLM)继承其训练数据和对齐过程中的偏见,对响应方式施加微妙影响。虽然已有许多研究探讨这些偏见,但鲜有工作考察其在相互作用期间的鲁棒性。本文引入一种新方法,其中两个LLM实例通过对立观点进行自我辩论,以说服一个中立版本的模型。通过这种方式,我们评估偏见的坚定程度以及模型是否容易强化错误信息或转向有害观点。我们的实验涵盖多个规模、来源和语言的LLM,为在语言和文化语境中理解偏见持久性和灵活性提供了更深入的见解。
引用
@article{arxiv.2410.13517,
title = {Bias in the Mirror: Are LLMs opinions robust to their own adversarial attacks ?},
author = {Virgile Rennard and Christos Xypolopoulos and Michalis Vazirgiannis},
journal= {arXiv preprint arXiv:2410.13517},
year = {2024}
}