基于双仿射分类器与深度神经网络的越南语法律问答信息抽取
计算与语言
2023-05-01 v1
摘要
本文提出使用深度神经网络从越南语法律问题中抽取重要信息,这是构建法律领域问答系统的一项基础任务。给定自然语言形式的法律问题,目标是抽取出所有包含回答问题所需信息的片段。我们引入一个分三阶段解决该任务的深度模型。首先,我们的模型利用近期先进的自编码语言模型生成上下文词嵌入,随后将其与字符级和词性标注信息结合以形成词表示。接下来,采用双向长短期记忆网络捕捉词间关系并生成句子级表示。在第三阶段,借鉴基于图的依存句法分析方法(其对输入句子提供全局视角)的思想,我们使用双仿射分类器估计每对起止词作为重要片段的概率。在公开越南语法律数据集上的实验结果表明,我们的模型大幅优于先前工作,F1分数达到94.79%。结果也证明了在有限数据集上训练时,使用从预训练语言模型抽取的上下文特征并结合字符级和词性标注等其他类型特征的有效性。
引用
@article{arxiv.2304.14447,
title = {Analyzing Vietnamese Legal Questions Using Deep Neural Networks with Biaffine Classifiers},
author = {Nguyen Anh Tu and Hoang Thi Thu Uyen and Tu Minh Phuong and Ngo Xuan Bach},
journal= {arXiv preprint arXiv:2304.14447},
year = {2023}
}
备注
accepted as the oral presentation at ICONIP 2021