中文

面向大语言模型的动态自强化框架:用于幻觉抑制的DSCC-HS

计算与语言 2025-09-18 v1 人工智能

摘要

大语言模型(LLM)幻觉是其可靠部署的重要障碍。当前方法如检索增强生成(Retrieval-Augmented Generation, RAG)往往是被动的。我们引入Dynamic Self-reinforcing Calibration for Hallucination Suppression(DSCC-HS),一种新型的主动框架,用于在自回归解码期间进行干预。受双过程认知理论启发,DSCC-HS使用一个紧凑的代理模型,作为事实对齐代理(Factual Alignment Proxy, FAP)和幻觉检测代理(Hallucination Detection Proxy, HDP)进行对抗性训练。在推理期间,这些代理通过在每个解码步骤注入一个实时驾驶向量来动态引导大目标模型,该驾驶向量是FAP和HDP logits之间的差异。这一即插即用的方法不需要修改目标模型。我们在TruthfulQA和BioGEN上的实验显示,DSCC-HS实现了最佳性能。在TruthfulQA上,它达到了99.2%的事实一致性率(Factual Consistency Rate, FCR)。在长期BioGEN基准上,它达到了最高的FActScore 46.50。这些结果表明DSCC-HS是提升LLM事实性的一种原则性且有效的解决方案。

关键词

引用

@article{arxiv.2509.13702,
  title  = {DSCC-HS: A Dynamic Self-Reinforcing Framework for Hallucination Suppression in Large Language Models},
  author = {Xiao Zheng},
  journal= {arXiv preprint arXiv:2509.13702},
  year   = {2025}
}