中文

基于不同量化值的LLM情感文本生成质量

计算与语言 2025-02-03 v1

摘要

大型语言模型在语言生成和理解方面展现出卓越的能力。这些进步使得AI系统能够生成更类人且更具情感吸引力的文本。然而,这些模型依赖大量参数,需要大量计算资源进行训练和推理。在某些场景下,访问这些资源可能具有挑战性(例如预算或硬件限制)。降低精度位数等技术可以使模型更节省内存,减少所需计算资源,但会牺牲准确性。本文探讨了情感文本生成(例如“我真的很喜欢在雪覆盖的森林里跑步”)中不同量化值、GPU RAM利用率和文本质量之间的权衡。为了评估,我们使用一个情感分类器和十个种子提示来生成情感文本。我们在来自两个不同家族的五个开源语言模型上测试了三种精度位数设置(8、16和32)。我们的发现表明,位数减少带来了内存节省,实现了76%的缩减。然而,这种优化伴随着权衡,导致较大模型的F1分数下降最多10个百分点,较小模型上升10个百分点,同时推理时间大约翻倍。在文本质量方面,较低量化水平的较大模型通常优于较小的高精度模型,同时所需内存相似。

关键词

引用

@article{arxiv.2501.19317,
  title  = {LLM-based Affective Text Generation Quality Based on Different Quantization Values},
  author = {Yarik Menchaca Resendiz and Roman Klinger},
  journal= {arXiv preprint arXiv:2501.19317},
  year   = {2025}
}