评估 1B 与 4B 参数 Gemma LLM 上 RAG 与 HyDE 在个人助理集成中的表现
计算与语言
2025-06-30 v1
摘要
资源效率是将大型语言模型(LLM)部署到边缘设备和隐私敏感应用中亟待解决的关键瓶颈。本研究评估了两种数据增强策略——检索增强生成(RAG)和假设文档嵌入(HyDE)——在 1 亿和 4 亿参数 Gemma LLM 上的效果,具体针对隐私优先的个人助理场景进行测试。我们通过 MongoDB 实现短期记忆,通过 Qdrant 实现长期语义存储,采用 FastAPI 与 LangChain 进行编排,并通过 React.js 前端暴露系统。无论模型规模,RAG 均可将延迟降低最高 17%,并在回答用户特定和领域特定查询时消除事实性幻觉。相比之下,HyDE 能提升语义相关性——尤其在复杂物理类 prompt 中——但导致响应时间增加 25%--40%,且在个人数据检索中出现显著幻觉率。对 1B 与 4B 模型的比较显示,规模化对基线和 RAG 流程仅带来边际的吞吐量提升,但放大了 HyDE 的计算开销和波动性。我们的发现表明,RAG 是面向小规模 LLM 的边缘设备个人助理的实用之选。
引用
@article{arxiv.2506.21568,
title = {Assessing RAG and HyDE on 1B vs. 4B-Parameter Gemma LLMs for Personal Assistants Integretion},
author = {Andrejs Sorstkins},
journal= {arXiv preprint arXiv:2506.21568},
year = {2025}
}
备注
Technical report as part of research project