TOPFORMER:基于拓扑感知的多风格深度伪造文本作者归属方法
计算与语言
2024-10-03 v3
摘要
大型语言模型(LLMs)的最新进展使得生成开放域高质量文本成为可能,这些文本与人工书写的文本难以区分。我们将此类LLM生成的文本称为深度伪造文本。目前在huggingface模型仓库中有超过72K个文本生成模型。因此,具有恶意意图的用户可以轻易使用这些开源LLM大规模生成有害文本和虚假/错误信息。为缓解此问题,需要一种计算方法来确定给定文本是否为深度伪造文本——即图灵测试(TT)。特别地,在这项工作中,我们研究了该问题更通用的版本,称为作者归属(AA),采用多分类设定——即不仅确定给定文本是否为深度伪造文本,还能 pinpoint 哪个LLM是作者。我们提出TopFormer,通过在基于Transformer的模型中加入拓扑数据分析(TDA)层以捕获深度伪造文本中更多语言模式,从而改进现有AA方案。我们通过从主干网络的重塑 中提取TDA特征作为输入,展示了在处理不平衡和多风格数据集时拥有TDA层的益处。该基于Transformer的模型捕获上下文表示(即语义和句法语言特征),而TDA捕获数据的形状和结构(即语言结构)。最后,TopFormer在所有3个数据集中均优于所有基线,宏F1分数提升高达7%。我们的代码和数据集可在 https://github.com/AdaUchendu/topformer 获取。
引用
@article{arxiv.2309.12934,
title = {TOPFORMER: Topology-Aware Authorship Attribution of Deepfake Texts with Diverse Writing Styles},
author = {Adaku Uchendu and Thai Le and Dongwon Lee},
journal= {arXiv preprint arXiv:2309.12934},
year = {2024}
}
备注
Accepted at The 27th European Conference on Artificial Intelligence (ECAI 2024)