融合双向长短期记忆与子词嵌入的作者身份归属
计算与语言
2023-06-28 v1 人工智能
机器学习
摘要
从多个候选作者中揭示给定文本文档作者的问题称为作者身份归属。多种基于词的风格标记已成功用于深度学习方法以处理作者身份归属的内在问题。遗憾的是,基于词的作者身份归属系统的性能受限于训练语料的词汇量。文献已推荐基于字符的风格标记作为克服隐藏词问题的替代方案。然而,基于字符的方法往往无法捕捉文本中词的序列关系,这是进一步改进的鸿沟。本文解决的问题是:是否可能在保留词的序列上下文的同时处理文本文档中隐藏词的歧义。为此,提出了一种基于双向长短期记忆(BLSTM)与二维卷积神经网络(CNN)的方法,以捕捉用于作者身份归属的序列写作风格。BLSTM 用于利用子词信息获取特征间的序列关系。二维 CNN 用于理解来自无标签输入文本的风格的局部句法位置。所提方法在 CCAT50、IMDb62、Blog50 和 Twitter50 公共语料库上针对众多最先进方法进行了实验评估。实验结果表明,在 CCAT50 和 Twitter 上准确率分别提升 1.07% 和 0.96%,并在其余数据集上取得可比结果。
引用
@article{arxiv.2306.14933,
title = {Integrating Bidirectional Long Short-Term Memory with Subword Embedding for Authorship Attribution},
author = {Abiodun Modupe and Turgay Celik and Vukosi Marivate and Oludayo O. Olugbara},
journal= {arXiv preprint arXiv:2306.14933},
year = {2023}
}
备注
8 pages, 4 figure