越南语文本到SQL语义解析的初步研究
计算与语言
2020-10-06 v1 人工智能
摘要
语义解析是一项重要的 NLP 任务。然而,越南语在该研究领域中是一种低资源语言。本文提出了首个公开的越南语大规模 Text-to-SQL 语义解析数据集。我们在该数据集上扩展并评估了两个强语义解析基线 EditSQL (Zhang et al., 2019) 与 IRNet (Guo et al., 2019)。我们比较了这两个基线的关键配置并发现:越南语自动分词提升了两个基线的解析结果;归一化点互信息(NPMI)得分 (Bouma, 2009) 有助于模式链接;从越南语神经依存解析器中提取的潜在句法特征同样改善了结果;且越南语单语语言模型 PhoBERT (Nguyen and Nguyen, 2020) 比近期最佳多语语言模型 XLM-R (Conneau et al., 2020) 取得了更高的性能。
引用
@article{arxiv.2010.01891,
title = {A Pilot Study of Text-to-SQL Semantic Parsing for Vietnamese},
author = {Anh Tuan Nguyen and Mai Hoang Dao and Dat Quoc Nguyen},
journal= {arXiv preprint arXiv:2010.01891},
year = {2020}
}
备注
EMNLP 2020 (Findings)