中文

渐进式训练用于可解释引用 grounding 对话:降低英-印地语 LLM 中的幻觉

计算与语言 2026-03-20 v1 人工智能

摘要

知识 grounding 对话系统旨在通过以外部知识来源为条件来生成信息丰富、情境相关的响应。然而,大多数现有方法仅关注英文,缺乏用于验证事实声明的明确引用机制,且对模型决策过程的透明度有限。我们提出 XKD-Dial,一个面向双语(英-印地语)环境的可解释、知识 grounding 对话生成的渐进式四阶段训练管道,包括:(1)多语言适应,(2)英语对话 SFT 带引用 grounding,(3)双语对话 SFT,(4)基于引用感知奖励的 GRPO 对齐。我们在每个管道阶段评估了六个模型,涵盖 encoder-decoder(250M-3B)和 decoder-only(1B-7B)架构。我们的主要贡献包括:(i)应用三种事后可解释性分析——交叉注意力对齐、集成梯度归因和遮挡-based 因果 grounding——在整个训练轨迹上系统性地揭示如何学习引用行为,不仅是是否学习;(ii)引用 grounding SFT 将 encoder-decoder 模型的幻觉率降至 0.0%;(iii)渐进式管道防止灾难性遗忘,同时提高印地语能力;(iv)较小的模型在 SFT 后匹配较大的模型在英语上的表现;(v)GRPO 在结构化引用任务上仅提供有限的改进。我们在六个自动评估指标(BLEU、ROUGE、BERTScore、FactScore、Citation-F1 和幻觉率)上进行评估。

关键词

引用

@article{arxiv.2603.18911,
  title  = {Progressive Training for Explainable Citation-Grounded Dialogue: Reducing Hallucination to Zero in English-Hindi LLMs},
  author = {Vedant Pandya},
  journal= {arXiv preprint arXiv:2603.18911},
  year   = {2026}
}

备注

30 pages, 15 figures, 11 tables. Comprehensive study across 6 LLMs (250M-7B parameters) with explainability analysis. Code and data available upon request