Frankentext:将随机文本片段拼接成长篇叙事
计算与语言
2026-04-21 v4
摘要
我们提出Frankentexts,一种长篇叙事生成范式,将LLM视为现有文本的作曲家,而非作者。给定写作提示和数千个随机抽样的人类撰写片段,模型被要求在大多数标记(例如90%)必须逐字复制自提供的段落中的情况下生成叙事。对于人类而言,这一任务实际上是不可行的:选择和排序片段会产生组合搜索空间,LLM会隐式地进行搜索,然后对选定的片段进行最小编辑和拼接,以构建连贯的长篇故事。尽管面临巨大的挑战,我们通过大规模的自动和人类评估发现,Frankentexts在写作质量、多样性和原创性方面显著优于纯粹的LLM生成,同时保持连贯性和与提示的相关性。此外,Frankentexts构成了AI生成文本检测器的根本性挑战:我们最佳的 Gemini 2.5 Pro配置所产生的72%的Frankentext被Pangram(一种最先进的检测器)误判为人类撰写。人类注释员赞赏Frankentexts的创意设想、生动的描述和干巴巴的幽默;另一方面,他们指出在较长的文本中,尤其是在较长的文本中,突兀的语调变化和不均衡的语法是问题。高质量Frankentext的出现引发了关于作者身份和版权的严重问题:当人类提供原始材料,LLM将其编排成新的叙事时,真正的所有权归属谁?
引用
@article{arxiv.2505.18128,
title = {Frankentext: Stitching random text fragments into long-form narratives},
author = {Chau Minh Pham and Jenna Russell and Dzung Pham and Mohit Iyyer},
journal= {arXiv preprint arXiv:2505.18128},
year = {2026}
}
备注
Accepted to ACL 2026