基于字符级 CNN 的孟加拉语文学作品作者归属
计算与语言
2020-11-06 v1 人工智能
机器学习
摘要
字符是文本中可提取文体特征信号以确定作者的最小单元。在本文中,我们研究了字符级信号在孟加拉语文学作品作者归属中的有效性,并表明结果有前景但仍有提升空间。所提出模型的时间和内存效率远高于词级对应模型,但准确率比性能最好的词级模型低 2-5%。我们对各种基于词的模型进行了比较,表明所提出模型随着数据集增大表现越来越好。我们还分析了在作者归属中对多样化孟加拉语字符集进行预训练字符嵌入的效果。可见预训练使性能提升高达 10%。我们使用了来自 6 到 14 位作者的 2 个数据集,在训练前对其进行平衡并比较结果。
引用
@article{arxiv.2001.05316,
title = {Authorship Attribution in Bangla literature using Character-level CNN},
author = {Aisha Khatun and Anisur Rahman and Md. Saiful Islam and Marium-E-Jannat},
journal= {arXiv preprint arXiv:2001.05316},
year = {2020}
}
备注
5 pages