大语言模型中的食谱记忆与创造力:是创意厨师、劣质厨师,还是单纯抄袭者?
计算与语言
2025-07-01 v1
摘要
本工作进展探讨了从大语言模型(LLM)生成的烹饪食谱中发现的记忆、创造力与荒谬现象。具体而言,我们旨在(i)使用小规模高质量的人类判断数据分析大语言模型的记忆、创造力与非 sense,以及(ii)评估潜在方法,以自动化人工标注,规模化本研究以处理大量食谱。为实现(i)目标,我们对20个由LLM(Mixtral)预选生成的食谱进行详细的人类标注,提取每道食谱的配料和步骤,以评估哪些元素是记忆的——即可追溯到在训练期间可能看到的在线资源——哪些元素源于真正的创造性综合或彻底的荒谬。我们发现Mixtral持续复用可在在线文档中找到的配料,可能在模型训练期间看到的,这表明其对记忆内容具有强烈依赖。为实现目标(ii)并将分析规模化 Beyond 小样本和单一LLM验证,我们设计了“LLM-as-judge”管道,自动化食谱生成、荒谬检测、配料和食谱步骤解析及其标注。例如,与人类标注结果比较,最佳的配料提取器和标注器是 Llama 3.1+Gemma 2 9B,实现配料匹配最高达78%准确率。该自动化框架使我们能够大规模量化生成食谱中的记忆、创造力与荒谬,提供模型创造力能力的严格证据。
引用
@article{arxiv.2506.23527,
title = {On Recipe Memorization and Creativity in Large Language Models: Is Your Model a Creative Cook, a Bad Cook, or Merely a Plagiator?},
author = {Jan Kvapil and Martin Fajcik},
journal= {arXiv preprint arXiv:2506.23527},
year = {2025}
}
备注
13 pages, 5 figures