何时信任上下文:基于自反式辩论的数据可靠性
计算与语言
2025-06-09 v1 人工智能
摘要
大型语言模型经常遇到的情形是其参数化知识与上下文输入之间存在冲突,常常导致事实性不一致或幻觉。我们提出了一种用于上下文可靠性的自反式辩论框架(Self-Reflective Debate for Contextual Reliability, SR-DCR),该框架将 token 级别的自信度与非对称多智能体辩论相结合,以裁决此类冲突。一种被剥夺了上下文的批评家挑战一种论据基于给定段落的防御者;裁判模型评估辩论并确定上下文的可靠性。最终答案通过结合裁决结果与模型置信度来选择。实验在 ClashEval 数据集上表明,SR-DCR 在抵御误导性上下文方面始终具有稳健性,同时在可信输入上保持准确性,凭借最小的计算开销,超越了经典辩论方法和仅依赖置信度的基线方法。代码已公开于 https://github.com/smiles724/Self-Reflective-Debates。
引用
@article{arxiv.2506.06020,
title = {When to Trust Context: Self-Reflective Debates for Context Reliability},
author = {Zeqi Zhou and Fang Wu and Shayan Talaei and Haokai Zhao and Cheng Meixin and Tinson Xu and Amin Saberi and Yejin Choi},
journal= {arXiv preprint arXiv:2506.06020},
year = {2025}
}