中文

多语言机器生成文本中的作者身份归属

计算与语言 2025-08-05 v1 人工智能 计算机与社会 人机交互 物理与社会

摘要

随着大型语言模型(LLM)达到类人水平的流畅性和连贯性,区分机器生成文本(MGT)与人类撰写内容的难度日益增加。虽然早期的MGT检测工作专注于二分类,但不断扩张和多样化的LLM格局需要更细致且具有挑战性的作者身份归属(AA),即能够识别特定生成器(LLM或人类)背后的文本。然而,当前的AA工作仍局限于单语言环境,英语是最受关注的语言,忽略了现代LLM的多语言特性和使用场景。在本文中,我们提出了多语言作者身份归属问题,这涉及跨多种语言对文本进行归属,以人类或多个LLM生成器身份进行归因。我们聚焦18种语言——涵盖多个语言家族和书写体系——以及8个生成器(7个LLM和人类-authored 类),探讨了单语言AA方法在多语言环境中的适用性、跨语言迁移性以及生成器对归属性能的影响。我们的结果表明,虽然某些单语言AA方法可适应于多语言环境,但在跨越不同语言家族时仍存在显著局限性和挑战,这凸显了多语言AA的复杂性,以及需要更健壮的方法以更好地匹配现实场景的需求。

关键词

引用

@article{arxiv.2508.01656,
  title  = {Authorship Attribution in Multilingual Machine-Generated Texts},
  author = {Lucio La Cava and Dominik Macko and Róbert Móro and Ivan Srba and Andrea Tagarelli},
  journal= {arXiv preprint arXiv:2508.01656},
  year   = {2025}
}