中文

LLMTrace:用于AI写入文本分类和细粒度定位的语料库

计算与语言 2025-09-26 v1

摘要

大型语言模型(Large Language Models, LLMs)生成类人文本的广泛使用 necessitates 发展 robust 检测系统。然而,进展受限于关键缺乏合适训练数据;现有数据集常常使用已过时的模型生成,主要以英语为主,且未能解决越来越常见的混合人类-AI 作者场景。关键的是,尽管一些数据集解决了混合作者,但没有提供所需的 character-level 注释以实现对AI生成片段在文本中精确定位。为此,我们介绍LLMTrace,一个新的大规模、双语(英语和俄语)语料库,用于AI生成文本检测。我们使用多样化的现代专有和开源LLMs构建了该数据集,旨在支持两个关键任务:传统的全文本二元分类(人类 vs. AI)以及 novel AI生成区间检测任务,通过 character-level 注释实现。我们认为LLMTrace将作为训练和评估下一代更细致且实用的AI检测模型的重要资源。项目页面位于\href{https://sweetdream779.github.io/LLMTrace-info/}{iitolstykh/LLMTrace}。

关键词

引用

@article{arxiv.2509.21269,
  title  = {LLMTrace: A Corpus for Classification and Fine-Grained Localization of AI-Written Text},
  author = {Irina Tolstykh and Aleksandra Tsybina and Sergey Yakubson and Maksim Kuprashevich},
  journal= {arXiv preprint arXiv:2509.21269},
  year   = {2025}
}