生成式 AI 与虚构性:小说如何驱动大语言模型
计算与语言
2026-03-03 v1
摘要
生成式模型(如 ChatGPT 中的模型)依赖其训练数据。这些模型本质上是基于从广泛文本中学习到的模式进行的下一个单词预测。自首次出现的 GPT 起,最受欢迎的数据集包括大量小说集合。对于构建这些模型的工程师和研究科学家来说,普遍认为小说中的语言足够丰富,能够涵盖各种社会和沟通现象,但这一信念大多未得到充分检视。小说如何塑造生成式 AI 的输出?具体而言,小说的效应相对于其他文本形式(如报纸、Reddit 和 Wikipedia)有何不同?自 1970 年代起,文学学者如 Catherine Gallagher 和 James Phelan 已经发展出关于小说如何作为话语和语言形式运作的稳健而有见解的理论。通过对一个有影响力的开源模型(BERT)的研究,我们发现大语言模型利用小说熟悉的属性和 affordances,同时也催生了新的特性和社会响应形式。我们认为,如果当代文化日益受生成式 AI 和机器学习的塑造,那么对当今各种文化生产模式的任何分析都必须考虑一个相对新颖的维度:计算训练数据。
引用
@article{arxiv.2603.01220,
title = {Generative AI & Fictionality: How Novels Power Large Language Models},
author = {Edwin Roland and Richard Jean So},
journal= {arXiv preprint arXiv:2603.01220},
year = {2026}
}