中文

面向俄文文本论证挖掘的传统机器学习与深度学习模型

计算与语言 2021-06-29 v1

摘要

论证挖掘是计算语言学的一个领域,致力于从文本中抽取并分类论点及其间关系,以及构建论证结构。俄语在此研究方向的一个重大障碍是缺乏标注的俄文文本语料库。本文探讨了基于 Persuasive Essays Corpus (PersEssays) 的机器翻译扩展俄文版 Argumentative Microtext Corpus (ArgMicro) 以提升论证挖掘质量的可能性。为使这两个语料库可联合使用,我们提出了基于 ArgMicro 与 PersEssays 所用方案的联合论证标注方案(Joint Argument Annotation Scheme)。我们使用传统机器学习技术(SVM、Bagging 和 XGBoost)以及深度神经网络(BERT 模型)解决了将论证话语单元(ADU)分类为“pro”(“支持”)与“opp”(“反对”)两类的问题。提出了 XGBoost 与 BERT 模型的集成,在两个语料库上均展现出最高的 ADU 分类性能。

关键词

引用

@article{arxiv.2106.14438,
  title  = {Traditional Machine Learning and Deep Learning Models for Argumentation Mining in Russian Texts},
  author = {Irina Fishcheva and Valeriya Goloviznina and Evgeny Kotelnikov},
  journal= {arXiv preprint arXiv:2106.14438},
  year   = {2021}
}

备注

13 pages, 6 tables, 4 figures. Accepted to Dialogue-2021 conference