negativas:用于搜索和分类语音数据中句子级否定的原型工具
计算与语言
2025-12-30 v1
摘要
否定是自然语言中的普遍特征。在巴西葡萄牙语中,最常使用的否定词是n~ao,它可以对名词或动词进行范围限制。当它限制动词时,n~ao可以出现在三个位置:前置动词(NEG1)、双重否定(NEG2)或后置动词(NEG3),例如n~ao gosto,n~ao gosto n~ao,gosto n~ao(“我不喜欢”)。从变体主义的角度,这些结构是不同形式的否定表达。从实用主义角度,它们发挥着不同的交际功能,例如礼貌和情态评估。尽管这些形式在语法上是可接受的,但它们的出现频率不同。NEG1在巴西各地区占主导地位,而NEG2和NEG3出现得更少,表明其使用受到情境限制的影响。这一低频率挑战了研究,常常导致对n~ao的动词否定进行主观、不可概括的解释。为此,我们开发了negativas,一个用于自动识别NEG1、NEG2和NEG3的工具。该工具的开发涉及四个阶段:i)分析来自Falares Sergipanos数据库的22份采访的数据集,这些数据集由三名语言学家注释,ii)使用自然语言处理(NLP)技术创建代码,iii)运行该工具,iv)评估准确率。注释者之间的一致性使用Fleiss\' Kappa测量,为中等(0.57)。该工具识别出3338个n~ao实例,将2085个分类为NEG1、NEG2或NEG3,实现了93%的成功率。然而,negativas存在局限性。NEG1占识别出的结构的91.5%,而NEG2和NEG3分别代表7.2%和1.2%。该工具在处理NEG2时存在困难,有时会将实例误分类为重叠结构(NEG1/NEG2/NEG3)。
关键词
引用
@article{arxiv.2504.04275,
title = {negativas: a prototype for searching and classifying sentential negation in speech data},
author = {Túlio Sousa de Gois and Paloma Batista Cardoso},
journal= {arXiv preprint arXiv:2504.04275},
year = {2025}
}