大语言模型幽默生成优化:温度配置与架构权衡
计算与语言
2025-04-07 v1 机器学习
摘要
大语言模型 (LLMs) 在创意文本生成方面显示出日益出色的能力,但其幽默生成的系统性评估仍未得到充分探索。本研究对13种最先进的LLMs进行全面分析,涵盖五种架构族,评估其在为软件开发人员生成技术相关幽默方面的性能。通过测试715种独特的温度设置和提示变体配置,评估模型输出的五个加权标准:幽默质量、领域相关性、概念原创性、语调精确度和交付效率。我们的 methodology 采用严格的统计分析,包括方差分析 (ANOVA)、相关性研究和二次回归,以识别最佳配置和架构影响。结果显示,不同模型之间存在显著的性能差异,其中某些架构比基线系统高出21.8%。温度敏感性分析表明,73%的模型在较低随机性设置 (<= 0.5) 时实现最佳性能,尽管最佳范围因架构而异。我们识别出两种模型聚类:紧凑型高性能模型在效率与质量之间取得平衡,而冗长型专家模型则需要更长的输出才能实现边际收益。统计验证确认,模型架构解释了38.7%的性能差异,幽默质量与概念原创性之间存在显著相关性。该研究建立了实用指南,用于模型选择和配置,阐明了温度调整和架构考虑如何影响幽默生成效果。这些发现推进了对LLM在创意技术写作中能力的理解,并为开发人员实施幽默生成系统提供了经验验证的配置策略。
引用
@article{arxiv.2504.02858,
title = {Optimizing Humor Generation in Large Language Models: Temperature Configurations and Architectural Trade-offs},
author = {Evgenii Evstafev},
journal= {arXiv preprint arXiv:2504.02858},
year = {2025}
}
备注
10 pages, 4 figures