中文

GhostWriteBench:检测与归因大型语言模型化书作家

计算与语言 2026-03-31 v1

摘要

本文引入 GhostWriteBench,这是一个用于大型语言模型作品归因的数据集。它包含由前沿大型语言模型生成的长篇文本(每本书 50K 字以上),旨在测试在多个 out-of-distribution(OOD)维度上的泛化能力,包括领域和未知大型语言模型作家。我们还提出了 TRACE——一种可解释且轻量级的新型指纹方法,适用于开源和闭源模型。TRACE 通过捕获由另一个轻量级语言模型估计的词级转换模式(例如词秩)来创建指纹。在 GhostWriteBench 上的实验表明,TRACE 实现了最先进的性能,能够在 OOD 设置下保持稳健性,并在数据有限的场景中表现良好。

关键词

引用

@article{arxiv.2603.28054,
  title  = {Who Wrote the Book? Detecting and Attributing LLM Ghostwriters},
  author = {Anudeex Shetty and Qiongkai Xu and Olga Ohrimenko and Jey Han Lau},
  journal= {arXiv preprint arXiv:2603.28054},
  year   = {2026}
}