N-GrAM:新型格罗宁根作者画像模型
计算与语言
2017-07-13 v1
摘要
我们描述了参与PAN 2017作者画像共享任务的情况,该任务用于识别英语、西班牙语、阿拉伯语和葡萄牙语作者的性别和语言变体。我们描述了最终提交的系统以及一系列负面结果。我们的目标是为性别和语言以及所有语言变体创建一个单一模型。我们性能最佳的系统(基于交叉验证结果)是一个线性支持向量机(SVM),以词unigrams和字符3至5元语法作为特征。一组附加特征,包括词性标签、额外数据集、地理实体和Twitter句柄,反而损害了而非提升了性能。交叉验证结果显示总体高性能,测试集结果证实了这一点,平均准确率为0.86,子任务表现范围在0.68到0.98之间。
引用
@article{arxiv.1707.03764,
title = {N-GrAM: New Groningen Author-profiling Model},
author = {Angelo Basile and Gareth Dwyer and Maria Medvedeva and Josine Rawee and Hessel Haagsma and Malvina Nissim},
journal= {arXiv preprint arXiv:1707.03764},
year = {2017}
}