中文

统一虚拟混合专家框架:增强单模型系统中的推理能力与缓解幻觉

计算与语言 2025-04-08 v1 人工智能 机器学习

摘要

生成模型(如 GPT 和 BERT)在文本生成和摘要等任务上的性能已得到显著提升。然而,幻觉(即“模型生成非事实或误导性内容”)在较小规模架构中尤为棘手,限制了其在现实世界中的适用性。在本文中,我们提出了一种统一的虚拟混合专家融合策略,该策略在不增加参数量的情况下,增强了单个 Qwen 1.5 0.5B 模型的推理性能并缓解了幻觉。我们的方法利用多个特定领域的专家提示(专家数量可调)从不同视角引导模型。我们应用基于均值和标准差的统计异常值截断策略来过滤异常高的概率预测,并向嵌入空间注入噪声以促进输出多样性。为了清晰评估每个模块的贡献,我们采用固定投票机制而非动态门控网络,从而避免额外的混淆因素。我们提供了来自统计和集成学习视角的详细理论推导,以证明我们的方法如何降低输出方差并抑制幻觉。在对话生成任务上的大量消融实验表明,我们的方法显著提高了小模型的推理准确性和鲁棒性。此外,我们讨论了评估虚拟专家正交性的方法,并概述了未来使用门控网络进行动态专家权重分配的潜在工作。

关键词

引用

@article{arxiv.2504.03739,
  title  = {A Unified Virtual Mixture-of-Experts Framework:Enhanced Inference and Hallucination Mitigation in Single-Model System},
  author = {Mingyan Liu},
  journal= {arXiv preprint arXiv:2504.03739},
  year   = {2025}
}