波斯语文本中的矛盾检测
计算与语言
2021-07-06 v1
摘要
语义矛盾句子的检测是诸如文本蕴涵识别等NLP应用中最具挑战性与基础性的问题之一。本研究中的矛盾包括不同类型的语义对立,如冲突与反义。由于缺乏充足数据以将精确的机器学习尤其是深度学习方法应用于波斯语及其他低资源语言,能类似这些系统运作的基于规则的方法将极具价值。此外,近期迁移学习等新方法的出现,为低资源语言的深度学习开辟了可能。鉴于上述两点,本研究在给出一个简单规则基基线的同时,引入了一种用于识别语义矛盾的新型规则基系统,以及一种用于波斯语文本的Bert基深度矛盾检测系统。该规则基系统使用频繁规则挖掘方法,借助开发集抽取恰当的矛盾规则。抽取的规则针对不同类别的矛盾句子进行测试。该系统中各矛盾类别的最大f值见于否定类,约90%,系统对所有类别的平均F值约76%,优于波斯语文本上的其他算法。另一方面,由于规则基系统对某些矛盾类别性能中等,我们使用基于自有翻译数据集的Bert基深度学习系统,平均F值为73。我们的混合系统f值约为80。
引用
@article{arxiv.2107.01987,
title = {Contradiction Detection in Persian Text},
author = {Zeinab Rahimi and Mehrnoush ShamsFard},
journal= {arXiv preprint arXiv:2107.01987},
year = {2021}
}
备注
24 pages, 9 tables and 5 figures