中文

迈向印地语文本中语言礼貌的自动识别

计算与语言 2021-12-01 v1

摘要

本文提出一种用于自动识别印地语文本中语言礼貌的分类器。我使用了超过 25,000 条人工标注的博客评论语料库来训练 SVM。借助关于礼貌的语篇和互动取向,本文阐述了印地语规范化的、约定俗成的礼貌结构。可见,将这些人工识别的结构作为特征用于训练 SVM,显著提升了分类器在测试集上的性能。训练后的系统达到超过 77% 的显著高准确率,距人类准确率仅在 2% 以内。

关键词

引用

@article{arxiv.2111.15268,
  title  = {Towards automatic identification of linguistic politeness in Hindi texts},
  author = {Ritesh Kumar},
  journal= {arXiv preprint arXiv:2111.15268},
  year   = {2021}
}