AI生成内容中的归因质量:基准测试风格嵌入与大语言模型判断器
计算与语言
2026-03-18 v1
摘要
随着大型语言模型(LLM)的普及,机器生成的文稿与人类写作日益相似,这使得对作者归因日益具有挑战性。我们在包含600个平衡实例的人类AI平行语料库(Human AI Parallel Corpus)上,对两种互补的归因机制进行基准测试:固定风格嵌入(Style Embeddings)和指令微调的大语言模型判断器(GPT-4o)。语料库涵盖六个领域:学术、新闻、小说、博客、口播记录与电视/电影剧本。每个实例包含人类提示词,以及来自GPT-4o或LLaMA-70B-Instruct的黄金续写与AI生成续写。风格嵌入基线在GPT续写上实现更高的整体准确率(82% vs. 68%)。在LLaMA续写方面,大语言模型判断器略胜于风格嵌入(85% vs. 81%),但结果未达统计显著性。关键在于,大语言模型判断器在小说与学术文体中显著优于风格嵌入,表明其具有语义敏感性;而风格嵌入在口播与剧本对话中占据优势,反映了其在结构上的强项。这些互补模式凸显归因是一个多维问题,需要混合策略。为保证可重复性,我们在GitHub提供代码,在Hugging Face提供衍生数据,均采用MIT许可证。本开源框架为AI生成内容的归因质量评估提供可复现的基准测试基准,同时综述了影响本工作的相关文献。
引用
@article{arxiv.2510.13898,
title = {Attribution Quality in AI-Generated Content:Benchmarking Style Embeddings and LLM Judges},
author = {Misam Abbas},
journal= {arXiv preprint arXiv:2510.13898},
year = {2026}
}
备注
Accepted for publication at the 2025 IEEE ICDM Workshop on "Grounding Documents with Reasoning, Agents, Retrieval, and Attribution". This is author submitted version. Not yet published