将 QNLP 的前沿扩展到英语之外:使用组合量子模型进行印地语情感分类的语法敏感流程
量子物理
2026-07-18 v1
摘要
自然语言处理(NLP)的进步,无论是在经典还是量子平台上,都主要集中于英语,因为它被广泛使用且语言资源丰富。尽管英语仍然是计算语言学中研究最多的语言,但作为世界上使用人数第三多的语言(仅次于普通话)的印地语,受到的关注相对有限。印地语主要在印度使用,在文字、句法结构和语言特征上与英语有显著差异。印地语使用天城文,表现出丰富的形态变化,并遵循主-宾-谓(SOV)词序,这与英语的主-谓-宾(SVO)结构不同。受印地语的语言复杂性及其在量子自然语言处理(QNLP)中代表性不足的启发,我们提出了一个面向印地语情感分类的语法感知 QNLP 流程,重点关注句子否定。我们使用一个手动标注的印地语情感数据集,标记为正面、负面或中性,并使用预群语法类型对句子进行编码。使用 Lambeq 处理句子,通过一种新颖的否定感知组合语法生成量子电路。训练混合量子神经网络(HQNN)用于二元和三元情感分类。我们的结果证明了有效的情感分类,并突出了组合 QNLP 对于形态丰富语言的潜力。
引用
@article{arxiv.2607.16765,
title = {Extending the Frontiers of QNLP Beyond English: Grammar-Sensitive Pipeline for Hindi Sentiment Classification Using Compositional Quantum Models},
author = {Gautami Sanjay Naik and Rishi Koushik Reddy Thippireddy and Naman Srivastava and Parishri Shah and Ravi Raj and Sunil Saumya and Aswath Babu H},
journal= {arXiv preprint arXiv:2607.16765},
year = {2026}
}
备注
10 pages, 6 figures