中文

HANSEN:用于作者分析的人类和AI口语文本基准

计算与语言 2023-10-26 v1

摘要

作者分析,也称为文体测量学,长期以来一直是自然语言处理(NLP)的一个重要方面。同样,大型语言模型(LLMs)近期的进展使得作者分析对于区分人类撰写文本和AI生成文本变得日益关键。然而,这些作者分析任务主要聚焦于书面文本,未考虑口语文本。因此,我们引入了最大的口语文本基准——HANSEN(Human ANd ai Spoken tExt beNchmark)。HANSEN包含对现有带转录文本的语音数据集的精心整理,以及新颖的AI生成口语文本数据集的创建。它总共包含17个人类数据集,以及使用3个著名LLMs:ChatGPT、PaLM2和Vicuna13B创建的AI生成口语文本。为评估和展示HANSEN的效用,我们对人类口语数据集进行了作者归属(AA)和作者验证(AV),并使用最先进(SOTA)模型进行了人类与AI口语文本检测。尽管SOTA方法(如字符n元语法或基于Transformer的模型)在人类口语数据集中表现出与书面文本相似的AA和AV性能,但在AI生成口语文本检测方面仍有很大改进空间。HANSEN基准可在以下地址获取:https://huggingface.co/datasets/HANSEN-REPO/HANSEN。

关键词

引用

@article{arxiv.2310.16746,
  title  = {HANSEN: Human and AI Spoken Text Benchmark for Authorship Analysis},
  author = {Nafis Irtiza Tripto and Adaku Uchendu and Thai Le and Mattia Setzu and Fosca Giannotti and Dongwon Lee},
  journal= {arXiv preprint arXiv:2310.16746},
  year   = {2023}
}

备注

9 pages, EMNLP-23 findings, 5 pages appendix, 6 figures, 17 tables