提示反向不一致性:超越生成随机性和提示释义的LLM自我不一致性
计算与语言
2025-07-31 v2
摘要
尽管LLM的不一致性并非新话题,但先前的研究主要关注两种类型的生成不一致性:i) 随机性不一致性:对同一LLM运行多次试验,产生不同的响应;ii) 释义不一致性:释义后的提示导致同一LLM产生不同的响应。随机性不一致性源于生成模型中随机采样带来的固有随机性,而释义不一致性是语言建模目标的结果,其中释义后的提示改变了词汇logits的分布。本研究发现了提示反向不一致性(PRIN),一种新的LLM自我不一致性形式:给定一个问题以及几个LLM生成的候选答案,当提示“哪些是正确的答案?”和“哪些是错误的答案?”时,LLM常常给出相互矛盾的响应。PRIN引发了一个重大担忧,因为它削弱了LLM作为评判者的可信度,并表明LLM在遵循基本逻辑规则方面存在挑战。我们进行了一系列实验来研究PRIN,考察了不同LLM中PRIN的程度、缓解方法、潜在应用,以及它与随机性不一致性和释义不一致性的关系。作为探索PRIN的首项研究,我们的发现为LLM的内部工作机制提供了宝贵见解,并有助于推进可信AI的发展。
引用
@article{arxiv.2504.01282,
title = {Prompt-Reverse Inconsistency: LLM Self-Inconsistency Beyond Generative Randomness and Prompt Paraphrasing},
author = {Jihyun Janice Ahn and Wenpeng Yin},
journal= {arXiv preprint arXiv:2504.01282},
year = {2025}
}
备注
accepted in COLM2025, 9 pages