基于语义特征的查询bandits以缓解幻觉:无保证查询重写
计算与语言
2025-08-26 v1 人工智能
机器学习
摘要
大语言模型(LLM)的高级推理能力导致幻觉现象更为普遍,但目前的缓解方法多聚焦于事后过滤,而忽视了影响幻觉产生的查询本身。我们引入QueryBandits框架,通过设计查询重写策略来最大化奖励模型,该模型基于输入查询中17种语言特征的敏感性来衡量幻觉倾向,从而主动引导LLM避免生成幻觉。我们在13个多样化问答基准测试中评估了QueryBandits,其中每组数据包含1,050个词汇扰动查询。我们的顶级上下文QueryBandits(采用Thompson抽样)相较于无查询重写基线以87.5%的胜率,并分别超过零样本静态提示("改写"或"扩展")的42.6%和60.3%。因此,我们实证证明了QueryBandits在以查询重写形式介入的方式中有效缓解幻觉。有趣的是,某些静态提示策略——即当前大量查询重写文献所采用的策略——的累积后悔值高于无查询重写基线,这表明静态重写可能加剧幻觉。此外,我们发现收敛后的每臂回归特征权重向量表明,没有单一的重写策略适用于所有查询。基于此,我们通过QueryBandits利用语义特征进行引导性重写,可通过前向传播机制在输出行为上实现显著偏移,无需重新训练或基于梯度的适应。
引用
@article{arxiv.2508.16697,
title = {QueryBandits for Hallucination Mitigation: Exploiting Semantic Features for No-Regret Rewriting},
author = {Nicole Cho and William Watson and Alec Koppel and Sumitra Ganesh and Manuela Veloso},
journal= {arXiv preprint arXiv:2508.16697},
year = {2025}
}