用于文体检测的孟加拉语语料库细粒度属性推断
计算与语言
2012-10-16 v1 计算机视觉与模式识别
摘要
文体学是从作者所写文档的特征中推断作者特征的科学,这是一项历史悠久的任务,属于文本分类的核心任务,涉及作者身份识别、抄袭检测、法医调查、计算机安全、版权和遗产纠纷等。在本工作中,我们提出了一种针对孟加拉语文档的文体检测策略。我们采用一组细粒度属性特征和一组词汇标记进行文本分析,并使用三种半监督度量进行决策。最后,采用多数投票方法进行最终分类。该系统完全自动且与语言无关。我们对孟加拉语作者文体检测的评估结果显示,与基线模型相比,其准确率相当可观。
引用
@article{arxiv.1210.3729,
title = {Inference of Fine-grained Attributes of Bengali Corpus for Stylometry Detection},
author = {Tanmoy Chakraborty and Sivaji Bandyopadhyay},
journal= {arXiv preprint arXiv:1210.3729},
year = {2012}
}
备注
5 pages, 2 figures, 4 tables. arXiv admin note: substantial text overlap with arXiv:1208.6268