增强作者身份识别中的表征泛化能力
计算与语言
2023-10-03 v1
摘要
作者身份识别旨在确定来源未公开文本的作者是谁。作者身份识别技术之所以能如此可靠地工作,归因于作者的写作风格被恰当地捕捉与表征。尽管现代作者身份识别方法多年来已显著演进,并已被证明能有效区分作者风格,但风格特征跨领域的泛化能力尚未得到系统审视。本文针对增强作者身份识别中风格表征的泛化能力这一挑战展开研究,尤其在训练样本与测试样本存在差异时。我们对实证研究进行了全面回顾,聚焦于各类风格特征及其在表征作者风格方面的有效性。同时探讨了主题、体裁与语域等影响写作风格的因素,以及减轻其影响的策略。尽管某些风格特征(如字符 n-gram 与功能词)已被证明具有鲁棒性与区分性,其他特征(如内容词)则可能引入偏差并阻碍跨领域泛化。利用深度学习模型(尤其是融合字符 n-gram 与句法信息的模型)学到的表征,在增强表征泛化方面展现出潜力。研究结果强调了在作者身份识别中选取恰当风格特征的重要性,特别是在跨领域场景下。对各种语言特征优劣的认知,为在多元语境下实现更精准的作者身份识别铺平了道路。
引用
@article{arxiv.2310.00436,
title = {Enhancing Representation Generalization in Authorship Identification},
author = {Haining Wang},
journal= {arXiv preprint arXiv:2310.00436},
year = {2023}
}