CollabStory:多 LLM 协作故事生成与作者身份分析
计算与语言
2025-02-12 v3 人工智能
摘要
统一框架的兴起使得 Large Language Models (LLMs) 之间的无缝互操作成为可能,为 LLM-LLM 协作开展开放式任务提供了可能。尽管如此,迄今为止尚未探索此类协作写作的可能性。我们进一步超越了人类-LLM 协作,探索了这种多 LLM 场景,通过生成第一个完全由 LLM 生成的协作故事数据集 CollabStory。我们关注从单作者到多作者(最多 5 位 LLM)的情境,其中多个 LLM 共同撰写故事。我们使用开源指令调优 LLM 生成超过 32k 篇故事。进一步地,我们借鉴了已设定人类-人类多作者写作任务标准的 PAN 任务,为多 LLM 场景扩展了他们的作者身份相关任务,并为 LLM-LLM 协作提供了基线方法。我们发现当前的基线方法无法处理这一新兴场景。因此,CollabStory 是一种资源,旨在推动理解以及开发新技术,以辨别多个 LLM 的使用。这在写作任务中至关重要,因为 LLM-LLM 协作可能在学术诚信、教育环境下的抄袭检测、信用归属以及版权侵权等方面引发重大挑战。我们在 https://github.com/saranya-venkatraman/CollabStory 上公开了数据集和代码。
关键词
引用
@article{arxiv.2406.12665,
title = {CollabStory: Multi-LLM Collaborative Story Generation and Authorship Analysis},
author = {Saranya Venkatraman and Nafis Irtiza Tripto and Dongwon Lee},
journal= {arXiv preprint arXiv:2406.12665},
year = {2025}
}
备注
Accepted to NAACL Findings 2025