中文

神经文本作者归属与混淆:数据挖掘视角

计算与语言 2023-03-14 v4 机器学习

摘要

在隐私研究中,日益重要且备受关注的两个相互交织的研究问题是作者归属(AA)与作者混淆(AO)。给定一件制品,尤其是一段待查文本 t,AA 解决方案旨在将 t 准确归属到众多候选作者中的真实作者,而 AO 解决方案旨在修改 t 以隐藏其真实作者身份。传统上,作者身份及其伴随的隐私问题仅针对人类作者。然而近年来,由于 NLP 中神经文本生成(NTG)技术的爆发式进展,能够合成具有人类水平的开放式文本(所谓“神经文本”),人们现在必须考虑由人类、机器或二者结合产生的作者身份。由于神经文本在恶意使用时的潜在威胁与影响,理解传统 AA/AO 解决方案的局限并开发应对神经文本的新型 AA/AO 解决方案已变得至关重要。因此,本综述从数据挖掘视角对近期关于神经文本作者归属与混淆的文献进行 comprehensive 回顾,并分享我们对其局限与有前景研究方向的看法。

关键词

引用

@article{arxiv.2210.10488,
  title  = {Attribution and Obfuscation of Neural Text Authorship: A Data Mining Perspective},
  author = {Adaku Uchendu and Thai Le and Dongwon Lee},
  journal= {arXiv preprint arXiv:2210.10488},
  year   = {2023}
}

备注

Accepted at ACM SIGKDD Explorations, Vol. 25, June 2023