多遍提示验证:提升量化模型在定性分析中的性能
计算与语言
2026-05-21 v1 人工智能
机器学习
摘要
量化大型语言模型(LLM)因运行快速、计算资源少,日益被用于定性分析。本研究考察不同低位量化水平(8位、4位、3位、2位)及量化类型对LLaMA-3.1(8B)在定性分析任务中性能的影响。研究采用82段访谈记录的专家与非专家回答。低位模型常产生更高水平的幻觉与结果不稳定,尤其在处理非专家语言、术语模糊时表现更差。为提升性能,我们提出一种量化感知的多遍提示验证方法。该方法通过受控步骤引导模型减少幻觉,剔除不可靠内容,将经验证的结果传递至下一段记录,提升准确性。为验证性能,人类编码员分别使用NVivo与BF16 LLaMA对记录进行编码。BF16 LLaMA-3.1输出精度高,但存在语义漂移与幻觉。人工纠正后输出与NVivo人工编码合并,构建了主题抽取与频率分析的金标准参考(GSGT)。结果显示,8位模型最接近GSGT;4位模型准确性下降但在采用所提方法后趋于稳定;3位与2位模型因压缩过重性能下降,但通过优化提示设计与验证改善。研究还发现,同位数级模型在量化类型下行为差异显著。总体而言,所提方法使低资源LLM在更低成本下更稳定、更准确,更适用于定性研究。
引用
@article{arxiv.2605.20193,
title = {Improving Quantized Model Performance in Qualitative Analysis with Multi-Pass Prompt Verification},
author = {Aisvarya Adeseye and Jouni Isoaho and Adeyemi Adeseye},
journal= {arXiv preprint arXiv:2605.20193},
year = {2026}
}
备注
Accepted to publish in 12th Intelligent Systems Conference 2026; 3-4 September 2026 in Amsterdam, The Netherlands