基于机器学习的矛盾检测模型的语言学考察:实证分析与未来展望
计算与语言
2022-10-20 v1
摘要
我们针对两个自然语言推理数据集的语言学特征进行分析。目标是识别那些机器学习模型尤其难以理解句法与语义属性。为此,我们还研究了众包、机器翻译的数据集(SNLI)与来自互联网源的文本对集合之间的差异。我们的主要发现是,该模型难以识别介词和动词的语义重要性,这凸显了具备语言学意识的预训练任务的重要性。此外,它常常无法理解反义词与同形异义词,尤其是当这些词依赖于上下文时。不完整的句子是另一个问题,较长的段落以及罕见词或短语也是如此。该研究表明,自动化语言理解需要一种更具信息量的方法,在训练过程中尽可能利用外部知识。
引用
@article{arxiv.2210.10434,
title = {A Linguistic Investigation of Machine Learning based Contradiction Detection Models: An Empirical Analysis and Future Perspectives},
author = {Maren Pielka and Felix Rode and Lisa Pucknat and Tobias Deußer and Rafet Sifa},
journal= {arXiv preprint arXiv:2210.10434},
year = {2022}
}
备注
Accepted at ICMLA 2022, 5 pages, 2 tables