Winning big with small models: Knowledge distillation vs. self-training for reducing hallucination in product QA agents
计算与语言
2025-07-22 v2 人工智能
机器学习
摘要
大型语言模型 (LLM) 在客户支持中的部署受到幻觉 (生成虚假信息) 和专有模型高成本的限制。为解决这些问题,我们提出了检索增强问答 (QA) 流水线,探讨人类输入与自动化之间的平衡。使用关于三星智能电视用户手册问题的数据集,我们证明了由 LLM 生成的合成数据在减少微调模型中的幻觉方面优于众包数据。我们还比较了自训练 (在模型自身输出上进行微调) 和知识蒸馏 (在更强模型输出上进行微调,如 GPT-4o),发现自训练在减少幻觉方面实现了相当的效果。我们推测,这一意外发现可归因于知识蒸馏情况下的增加暴露偏差问题,并通过后验分析予以支持。我们还通过包含情境化 "我不知道" 响应来提高对不可回答问题和检索失败的鲁棒性。这些发现表明,可以使用合成数据和开源模型进行自训练,构建可扩展且高性价比的 QA 系统,减少对专有工具或高成本人工标注的依赖。
引用
@article{arxiv.2502.19545,
title = {Winning Big with Small Models: Knowledge Distillation vs. Self-Training for Reducing Hallucination in Product QA Agents},
author = {Ashley Lewis and Michael White and Jing Liu and Toshiaki Koike-Akino and Kieran Parsons and Ye Wang},
journal= {arXiv preprint arXiv:2502.19545},
year = {2025}
}