大型语言模型能否识别作者身份?
计算与语言
2024-10-23 v2
摘要
准确识别作者身份的能力对于验证内容真实性和减少错误信息至关重要。大型语言模型(LLMs)已展现出卓越的推理和问题解决能力。然而,它们在作者身份分析方面的潜力仍未得到充分探索。传统研究依赖于手工设计的文体特征,而最先进的方法则利用预训练语言模型的文本嵌入。这些方法通常需要在标注数据上进行微调,在跨领域应用中往往性能下降,且可解释性有限。本研究旨在探讨三个研究问题:(1) LLMs能否有效执行零样本、端到端的作者身份验证?(2) LLMs能否在多个候选作者(例如10位和20位)中准确归属作者身份?(3) LLMs能否在作者身份分析中提供可解释性,特别是通过语言特征的作用?此外,我们研究了显式语言特征的整合,以引导LLMs的推理过程。我们的评估表明,LLMs无需领域特定的微调即可熟练完成这两项任务,并通过对语言特征的详细分析为其决策提供解释。这为未来基于LLM的作者身份分析研究建立了新的基准。
引用
@article{arxiv.2403.08213,
title = {Can Large Language Models Identify Authorship?},
author = {Baixiang Huang and Canyu Chen and Kai Shu},
journal= {arXiv preprint arXiv:2403.08213},
year = {2024}
}
备注
Accepted to EMNLP 2024 Findings. The main paper is 9 pages long, with 16 pages total. The code, results, dataset, and additional resources are available on the project website: https://llm-authorship.github.io/