孟加拉语文学中的作者身份识别:一项比较分析
计算与语言
2013-02-26 v4 信息检索
摘要
文体计量学旨在研究个体独特的语言风格和写作行为,属于文本分类的核心任务,如作者身份识别、抄袭检测等。尽管针对英语的研究已有相当数量,但迄今为止在孟加拉语方面尚未开展重要工作。本文展示了针对孟加拉语文档的作者身份识别演示。我们采用一组细粒度的文体特征进行文本分析,并据此构建了两个不同的模型:由三种度量及其组合构成的统计相似度模型,以及包含决策树、神经网络和 SVM 的机器学习模型。实验结果表明,经过 10 折交叉验证后,SVM 的性能优于其他最先进的方法。我们还验证了各文体特征的相对重要性,表明其中一些特征在本实验所使用的每个模型中均保持显著性。
引用
@article{arxiv.1208.6268,
title = {Authorship Identification in Bengali Literature: a Comparative Analysis},
author = {Tanmoy Chakraborty},
journal= {arXiv preprint arXiv:1208.6268},
year = {2013}
}
备注
9 pages, 5 tables, 4 pictures