在作者归属中利用 LLM 能力的贝叶斯方法
计算与语言
2024-10-30 v1 人工智能
应用统计
摘要
作者归属旨在识别文档的来源或作者。传统方法严重依赖人工特征,且无法捕捉长程相关性,限制了其有效性。最近的进展利用了来自预训练语言模型的文本嵌入,这需要在标注数据上进行大量微调,在数据依赖性和有限的可解释性方面带来了挑战。大语言模型(LLM)凭借其深度推理能力和维持长程文本关联的能力,提供了一种有前景的替代方案。本研究探讨了预训练 LLM 在单样本作者归属中的潜力,特别是利用了贝叶斯方法和 LLM 的概率输出。我们的方法计算了文本蕴含某位作者过往写作的概率,反映了对作者身份更细致的理解。仅使用诸如 Llama-3-70B 的预训练模型,我们在 IMDb 和博客数据集上的结果显示,在十位作者的单样本作者分类中达到了 85% 的准确率。我们的发现为使用 LLM 进行单样本作者分析设定了新的基线,并扩展了这些模型在法律语言学中的应用范围。这项工作还包含了广泛的消融研究以验证我们的方法。
引用
@article{arxiv.2410.21716,
title = {A Bayesian Approach to Harnessing the Power of LLMs in Authorship Attribution},
author = {Zhengmian Hu and Tong Zheng and Heng Huang},
journal= {arXiv preprint arXiv:2410.21716},
year = {2024}
}